中文

Mega-TTS:具有内在归纳偏置的大规模零样本文本到语音合成

音频与语音处理 2023-06-07 v1 人工智能 声音

摘要

将文本到语音(TTS)扩展到大规模野生数据集已被证明在实现音色与语音风格泛化方面高度有效,尤其在零样本 TTS 中。然而,以往工作通常使用音频编解码器将语音编码为隐变量,并采用自回归语言模型或扩散模型生成,这忽略了语音的内在本质,可能导致次优或不可控的结果。我们认为语音可分解为若干属性(如内容、音色、韵律和相位),且每一属性均应由具有适当归纳偏置的模块建模。基于此观点,我们精心设计并训练了一个新颖且大规模的零样本 TTS 系统 Mega-TTS,其使用大规模野生数据训练,并以不同方式建模不同属性:1)我们仍选择谱图作为中间特征,而非使用音频编解码器编码的隐变量,因为谱图能很好地将相位与其他属性分离;相位可由基于 GAN 的声码器恰当构建,无需语言模型建模。2)我们使用全局向量建模音色,因为音色是随时间缓慢变化的全局属性。3)我们进一步使用基于 VQGAN 的声学模型生成谱图,并使用隐码语言模型拟合韵律分布,因为韵律在句中随时间快速变化,而语言模型可捕捉局部与长程依赖。我们将 Mega-TTS 扩展到含 20K 小时语音的多领域数据集,并在未见说话人上评估其性能。实验结果表明,得益于各模块的恰当归纳偏置,Mega-TTS 在零样本 TTS、语音编辑和跨语言 TTS 任务上超越最先进的 TTS 系统,具有更优的自然度、鲁棒性与说话人相似度。音频样本见 https://mega-tts.github.io/demo-page。

关键词

引用

@article{arxiv.2306.03509,
  title  = {Mega-TTS: Zero-Shot Text-to-Speech at Scale with Intrinsic Inductive Bias},
  author = {Ziyue Jiang and Yi Ren and Zhenhui Ye and Jinglin Liu and Chen Zhang and Qian Yang and Shengpeng Ji and Rongjie Huang and Chunfeng Wang and Xiang Yin and Zejun Ma and Zhou Zhao},
  journal= {arXiv preprint arXiv:2306.03509},
  year   = {2023}
}