Voicebox

访问官网

Voicebox是MetaAI推出的多语言语音生成研究模型,基于非自回归流匹配架构,支持六种语言的零样本TTS、瞬时噪声消除、语音内容编辑和跨语言风格迁移,生成速度比传统模型快20倍,目前未公开发布模型代码。

分类: AI音频与语音配音与语音合成 #语音生成 #语音合成 #AI语音 #噪声消除 #配音与语音合成 #语音编辑

Voicebox是Meta AI(原Facebook AI Research)推出的多语言通用语音生成研究模型。它基于非自回归流匹配架构,通过在大规模数据上学习文本引导的语音填充任务,实现了在多种语音任务上超越专用模型的表现。Voicebox支持六种语言(英语、法语、德语、西班牙语、波兰语和葡萄牙语),生成速度比传统的自回归模型快20倍。

核心能力

Voicebox通过上下文学习实现了多项未经专门训练的语音能力。零样本文本转语音:输入一段参考音频(风格提示)和目标文本,Voicebox即可合成具有参考音频风格的语音,包括声音特征、背景噪声和说话风格。瞬时噪声消除:当录音被门铃或狗叫声等瞬时噪声打断时,Voicebox可以像魔术橡皮擦一样重新生成被噪声破坏的语音片段。语音内容编辑:可以修正录音中说错的词语,无需重新录制音频。跨语言风格迁移:可以用一种语言的语音风格生成另一种语言的语音,例如用法语说话者的声音风格说出英语。多样化语音采样:无需任何音频条件即可生成独特且富有表现力的语音样本。

技术架构

Voicebox采用非自回归流匹配模型,训练目标是在给定音频上下文和文本的情况下填充语音。其灵活性优于自回归模型,因为它可以同时利用过去和未来的上下文。英语版Voicebox在6万小时数据上训练,多语言版在5万小时数据上训练。模型在多个基准测试中展示了超过现有模型的效果。

为什么未发布

Meta AI在官网上明确表示,由于语音生成技术存在滥用风险(如深度伪造),Voicebox的模型和代码目前不会公开发布。研究团队已开发了一个高效的分类器,可以区分真实语音和Voicebox生成的音频,作为风险缓解措施。Meta认为需要在研究开放性和负责任使用之间取得平衡。

注意事项

Voicebox目前是研究项目而非商业产品,模型和代码不公开发布。Audio Demo中展示的效果是在受控研究环境下获得的最佳结果,实际场景中的表现可能有所差异。对AI语音合成工具的使用应遵守相关法律法规和伦理准则,避免用于诈骗、欺诈或虚假信息传播。

编辑判断

Voicebox代表了Meta AI在语音合成领域的前沿研究水平。其多项语音能力的整合(TTS+去噪+编辑+风格迁移)在同一模型中实现是一个技术亮点。但由于模型未公开发布,对普通用户的实际使用价值有限,更多是研究参考意义。

继续探索 AI 工具

从同类、热门或新收录工具里快速找下一站。

返回工具列表