中文

ZMM-TTS:基于自监督离散语音表征的零样本多语言多说话人语音合成

声音 2024-08-28 v2 音频与语音处理

摘要

神经文本转语音 (TTS) 已在单说话人、单语言合成中实现了类人合成语音。由于缺乏大规模配对文本和录音室级音频数据,多语言 TTS 系统局限于资源丰富的语言。TTS 系统通常基于单个说话人的声音构建,但开发仅利用几秒语音即可为新说话人合成声音的系统正引起越来越多的兴趣。本文提出了 ZMM-TTS,这是一个利用大规模预训练自监督模型中的量化潜在语音表征的多语言多说话人框架。我们的论文结合了基于文本和基于语音的自监督学习模型,用于多语言语音合成。我们提出的模型不仅对未见说话人具有零样本泛化能力,对未见语言也是如此。我们通过一系列实验进行了全面的主客观评估。我们的模型在六种高资源语言中,针对可见和未见说话人,在语音自然度和相似度方面均被证明有效。我们还在两种假设的低资源语言上测试了该方法的效率。结果令人鼓舞,表明我们提出的方法即使在没有新未见语言的任何训练数据的情况下,也能合成可懂度高且与目标说话人声音高度相似的音频。

关键词

引用

@article{arxiv.2312.14398,
  title  = {ZMM-TTS: Zero-shot Multilingual and Multispeaker Speech Synthesis Conditioned on Self-supervised Discrete Speech Representations},
  author = {Cheng Gong and Xin Wang and Erica Cooper and Dan Wells and Longbiao Wang and Jianwu Dang and Korin Richmond and Junichi Yamagishi},
  journal= {arXiv preprint arXiv:2312.14398},
  year   = {2024}
}

备注

Accepted by IEEE/ACM TASLP, 16 pages plus 1 page of bio and photos