利用低质量语码转换数据改进跨语言语音克隆
声音
2022-11-18 v2 计算与语言
音频与语音处理
摘要
最近,序列到序列(seq-to-seq)模型已成功应用于文本到语音(TTS),以合成单语言文本的语音。要合成多种语言的语音,通常需要目标说话人的多语言语音。然而,为目标说话人收集高质量的多语言 TTS 数据既费力又昂贵。在本文中,我们提出使用来自非目标说话人的低质量语码转换发现数据,以实现目标说话人的跨语言语音克隆。实验表明,我们提出的方法在自然度和说话人一致性方面,均能以目标音色生成高质量的语码转换语音。更重要的是,我们发现我们的方法在跨语言语音克隆方面可以取得与 SOTA 相当的性能。
引用
@article{arxiv.2110.07210,
title = {Improve Cross-lingual Voice Cloning Using Low-quality Code-switched Data},
author = {Haitong Zhang and Yue Lin},
journal= {arXiv preprint arXiv:2110.07210},
year = {2022}
}