
昨天,火山引擎扔出一颗“音频炸弹”:豆包音频生成模型1.0正式发布。你只需要输入一句话或一段音频,它就能端到端给你整出一段完整的音频作品——对白、音效、背景音乐全都有,而且直接可以拿去用。过去做一段成片音频,得先录对白、找音效、挑配乐,然后手动对齐、多轨混音,光后期剪就能把人逼疯。现在,这一切被压缩进一条指令。举个例子,你写“咖啡馆里,两个人轻声聊天,偶尔传来笑声,窗外下雨”,模型就能立刻输出一段带有对话、雨声、背景音乐的作品,连笑声的停顿和叹气细节都给你嵌入进去。创作者就像当上了“音频导演”,动动嘴就拿到成品,再也用不着跟一堆音频轨道死磕。
最让长音频创作者头疼的问题,是角色声音前后不一致——第1分钟和第10分钟听起来像两个人。豆包音频生成模型1.0做到了文生音频与参考音频深度联动,在长音频里保持音色高度统一,创作者不用逐段比对、反复修音。目前单次支持2分钟音频,但可以通过多次延长功能在长程生成中保持音色一致,适合有声书、播客、长剧集。更厉害的是,它还支持音色与风格解耦,同一个声音能切换不同情绪,甚至实现“一声多角”——一个声音在不同角色设定下说出差异化表达。这大大提升了角色配音和创意音频的灵活性。
目前火山方舟已开启API邀测,个人用户可以在体验中心免费创作30分钟音频。豆包音频生成模型1.0很快也会上线剪映、即梦、番茄等产品。这意味着,AI音频制作的门槛被砍到了“一句话”,任何会打字的人都能当音频导演。当AI能帮你搞定所有后勤,创意就成了唯一的门槛。