中文

利用低质量语码转换数据改进跨语言语音克隆

声音 2022-11-18 v2 计算与语言 音频与语音处理

摘要

最近,序列到序列(seq-to-seq)模型已成功应用于文本到语音(TTS),以合成单语言文本的语音。要合成多种语言的语音,通常需要目标说话人的多语言语音。然而,为目标说话人收集高质量的多语言 TTS 数据既费力又昂贵。在本文中,我们提出使用来自非目标说话人的低质量语码转换发现数据,以实现目标说话人的跨语言语音克隆。实验表明,我们提出的方法在自然度和说话人一致性方面,均能以目标音色生成高质量的语码转换语音。更重要的是,我们发现我们的方法在跨语言语音克隆方面可以取得与 SOTA 相当的性能。

关键词

引用

@article{arxiv.2110.07210,
  title  = {Improve Cross-lingual Voice Cloning Using Low-quality Code-switched Data},
  author = {Haitong Zhang and Yue Lin},
  journal= {arXiv preprint arXiv:2110.07210},
  year   = {2022}
}