NaturalSpeech 2:隐扩散模型作为自然且零样本语音与歌唱合成器
音频与语音处理
2023-05-31 v3 人工智能
计算与语言
机器学习
声音
摘要
将文本转语音(TTS)扩展到大规模、多说话人及真实场景(in-the-wild)数据集,对于捕捉人类语音中的多样性(如说话人身份、韵律与风格(例如歌唱))十分重要。当前大型TTS系统通常将语音量化为离散token并使用语言模型逐一生成这些token,其存在韵律不稳定、词语跳过/重复问题以及音质较差等缺陷。本文开发了NaturalSpeech 2,一种利用带残差向量量化器的神经音频编解码器获取量化潜向量,并使用扩散模型在文本输入条件下生成这些潜向量的TTS系统。为增强对实现多样语音合成至关重要的零样本能力,我们设计了语音提示机制以促进扩散模型及时长/音高预测器中的上下文学习。我们将NaturalSpeech 2扩展到包含44K小时语音与歌唱数据的大规模数据集,并在未见说话人上评估其音质。NaturalSpeech 2在零样本设定下于韵律/音色相似度、鲁棒性与音质方面大幅优于以往TTS系统,并仅借助语音提示即可实现新颖的零样本歌唱合成。音频样本见 https://speechresearch.github.io/naturalspeech2。
引用
@article{arxiv.2304.09116,
title = {NaturalSpeech 2: Latent Diffusion Models are Natural and Zero-Shot Speech and Singing Synthesizers},
author = {Kai Shen and Zeqian Ju and Xu Tan and Yanqing Liu and Yichong Leng and Lei He and Tao Qin and Sheng Zhao and Jiang Bian},
journal= {arXiv preprint arXiv:2304.09116},
year = {2023}
}
备注
A large-scale text-to-speech and singing voice synthesis system with latent diffusion models. Update: NaturalSpeech 2 extension to voice conversion and speech enhancement