中文

NaturalSpeech 3:基于分解编解码器和扩散模型的零样本语音合成

音频与语音处理 2024-04-24 v3 人工智能 计算与语言 机器学习 声音

摘要

虽然近期的大规模文本到语音(TTS)模型在语音质量、相似度和韵律方面取得了显著进展,但仍不足以满足实际需求。考虑到语音包含多种属性(如内容、韵律、音色和声学细节),这对生成带来了巨大挑战,自然的想法是将语音分解为表示不同属性的各个子空间,并分别生成它们。为此,我们提出NaturalSpeech 3,一种基于分解扩散模型的TTS系统,实现零样本自然语音生成。具体而言,1)我们设计了带有分解向量量化(FVQ)的神经编解码器,将语音波形分解为内容、韵律、音色和声学细节的子空间;2)我们提出了分解扩散模型,根据每个子空间对应的提示生成各自属性。通过这种分解设计,NaturalSpeech 3能够以divide-and-conquer的方式高效地建模复杂语音。实验表明,NaturalSpeech 3在质量、相似度、韵律和可理解性方面均优于当前最先进的TTS系统,与人类录音质量相当。此外,随着参数规模达到10亿、训练数据达到20万小时,性能进一步提升。

关键词

引用

@article{arxiv.2403.03100,
  title  = {NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models},
  author = {Zeqian Ju and Yuancheng Wang and Kai Shen and Xu Tan and Detai Xin and Dongchao Yang and Yanqing Liu and Yichong Leng and Kaitao Song and Siliang Tang and Zhizheng Wu and Tao Qin and Xiang-Yang Li and Wei Ye and Shikun Zhang and Jiang Bian and Lei He and Jinyu Li and Sheng Zhao},
  journal= {arXiv preprint arXiv:2403.03100},
  year   = {2024}
}

备注

Achieving human-level quality and naturalness on multi-speaker datasets (e.g., LibriSpeech) in a zero-shot way