利用迁移学习使TTS模型适配新说话人
声音
2022-04-07 v2 计算与语言
音频与语音处理
摘要
为新说话人训练神经文本转语音(TTS)模型通常需要数小时高质量语音数据。先前关于语音克隆的工作试图通过使用新说话人几分钟语音数据使预训练多说话人TTS模型适配新声音来应对这一挑战。然而,公开可用的大型多说话人数据集通常含有噪声,从而导致不适合产品使用的TTS模型。我们通过提出迁移学习指南来应对这一挑战,即仅使用几分钟语音数据使高质量单说话人TTS模型适配新说话人。我们使用新说话人的不同数据量进行了广泛研究,并从自然度以及与目标说话人的声音/风格相似度方面评估合成语音。我们发现,仅在30分钟数据上微调单说话人TTS模型,对于男性和女性目标说话人,均可取得与在超过27小时数据上从头训练的模型相当的性能。
引用
@article{arxiv.2110.05798,
title = {Adapting TTS models For New Speakers using Transfer Learning},
author = {Paarth Neekhara and Jason Li and Boris Ginsburg},
journal= {arXiv preprint arXiv:2110.05798},
year = {2022}
}
备注
Submitted to Interspeech 2022