ByteDance lance Seed Audio 1.0, génère des dialogues et des effets sonores à partir d’une seule invite

D’après Beating, la Seed Audio 1.0 de ByteDance a été lancée le 22 juillet, permettant la génération de dialogues, d’effets sonores et d’audio d’ambiance à l’aide d’un seul prompt, avec une précision de synchronisation de 100 ms. Le modèle accepte des entrées en texte et en audio de référence, peut produire environ deux minutes d’audio par génération grâce à des capacités étendues, et conserve des voix de personnages cohérentes d’une sortie à l’autre.

L’audio affiche plus de 90 % d’utilisabilité dans la plupart des scénarios, avec un Mean Opinion Score (MOS) supérieur à 4 dans la majorité des langues prises en charge. Seed Audio 1.0 prend en charge 20+ langues, avec transfert de voix interlingue et personnalisation du ton. Le modèle est désormais disponible via le centre d’expérience Volcano Ark, avec une intégration API ouverte.

Avertissement : Les informations figurant sur cette page peuvent provenir de sources tierces et sont fournies à titre indicatif uniquement. Elles ne reflètent pas les points de vue ou opinions de Gate et ne constituent pas un conseil financier, d’investissement ou juridique. Le trading des actifs virtuels comporte des risques élevés. Veuillez ne pas vous fonder uniquement sur les informations de cette page pour prendre vos décisions. Pour en savoir plus, consultez l’avertissement.
Commentaire
0/400
Aucun commentaire