据称,字节跳动的 Seed Audio 1.0 于 7 月 22 日上线,支持通过单次提示生成对话、音效和环境音频,并实现 100ms 的时间精度。该模型支持文本与参考音频输入,每次生成可产出约两分钟音频,并在扩展能力下进一步增强;同时能够在各输出中保持一致的角色音色。
在大多数场景中,音频可用性超过 90%,且在多数支持语言中,平均意见分数(MOS)超过 4。Seed Audio 1.0 支持 20+ 种语言,具备跨语言语音迁移与音调定制。该模型现已通过 Volcano Ark 体验中心上线,并开放 API 集成。