Voicebox:大规模文本引导的多语言通用语音生成
音频与语音处理
2023-10-20 v2 计算与语言
机器学习
声音
摘要
GPT 和 DALL-E 等大规模生成模型已经革新了研究界。这些模型不仅生成高保真输出,而且是能够解决未明确教授任务的通用模型。相比之下,语音生成模型在规模和任务泛化方面仍然处于原始阶段。在本文中,我们提出 Voicebox,这是规模最大且最通用的文本引导语音生成模型。Voicebox 是一个非自回归流匹配模型,训练用于在给定音频上下文和文本的情况下填充语音,其训练数据超过 50K 小时且未经滤波或增强。与 GPT 类似,Voicebox 可以通过上下文学习执行许多不同任务,但更灵活,因为它也可以基于未来上下文进行条件生成。Voicebox 可用于单语或跨语种零样本文本到语音合成、去噪、内容编辑、风格转换以及多样化样本生成。特别地,Voicebox 在可懂度(词错误率 5.9% 对比 1.9%)和音频相似度(0.580 对比 0.681)上均优于最先进的零样本 TTS 模型 VALL-E,同时速度最高快 20 倍。音频样本见 \url{https://voicebox.metademolab.com}。
引用
@article{arxiv.2306.15687,
title = {Voicebox: Text-Guided Multilingual Universal Speech Generation at Scale},
author = {Matthew Le and Apoorv Vyas and Bowen Shi and Brian Karrer and Leda Sari and Rashel Moritz and Mary Williamson and Vimal Manohar and Yossi Adi and Jay Mahadeokar and Wei-Ning Hsu},
journal= {arXiv preprint arXiv:2306.15687},
year = {2023}
}
备注
Accepted to NeurIPS 2023