中文

学习流利地说外语:多语言语音合成与跨语言声音克隆

计算与语言 2019-07-25 v2 声音 音频与语音处理

摘要

我们提出了一种基于 Tacotron 的多说话人、多语言文本到语音(TTS)合成模型,能够生成多种语言的高质量语音。此外,该模型能够实现跨语言的声音迁移,例如使用英语说话人的声音合成流利的西班牙语语音,而无需在任何双语或平行语料上训练。这种迁移在远缘语言之间也有效,例如英语和普通话。实现该结果的关键在于:1. 使用音素输入表示以鼓励模型容量跨语言共享;2. 引入对抗损失项以鼓励模型将其说话人身份表示(在训练数据中与语言完全相关)与语音内容解耦。通过每种语言多个说话人的训练进一步扩展模型规模,并引入自编码输入以帮助稳定训练期间的注意力,所得模型可一致地为训练中所有语言的训练说话人合成可懂语音,且带有母语或外语口音。

关键词

引用

@article{arxiv.1907.04448,
  title  = {Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning},
  author = {Yu Zhang and Ron J. Weiss and Heiga Zen and Yonghui Wu and Zhifeng Chen and RJ Skerry-Ryan and Ye Jia and Andrew Rosenberg and Bhuvana Ramabhadran},
  journal= {arXiv preprint arXiv:1907.04448},
  year   = {2019}
}

备注

5 pages, submitted to Interspeech 2019