低资源多语言与零样本多说话人语音合成
计算与语言
2022-10-25 v1 声音
音频与语音处理
摘要
尽管神经文本到语音(TTS)方法在建模多说话人方面取得了巨大进展,即使在零样本设置中也是如此,但这些方法所需的数据量对于全球超过 6000 种口语中的绝大多数而言通常不可行。在本工作中,我们将零样本声音克隆与多语言低资源 TTS 任务结合在一起。利用语言无关元学习(LAML)程序及对 TTS 编码器的修改,我们表明系统仅使用 5 分钟训练数据即可学会说一种新语言,同时保留推断新学语言中甚至未见过的说话人声音的能力。我们利用客观指标及人类研究,在可懂度、自然度和与目标说话人相似度方面展示了所提方法的成功,并以开源方式提供了我们的代码与训练模型。
引用
@article{arxiv.2210.12223,
title = {Low-Resource Multilingual and Zero-Shot Multispeaker TTS},
author = {Florian Lux and Julia Koch and Ngoc Thang Vu},
journal= {arXiv preprint arXiv:2210.12223},
year = {2022}
}
备注
Accepted to AACL 2022