YourTTS:面向人人的零样本多说话人 TTS 与零样本语音转换
声音
2023-05-02 v4 计算与语言
音频与语音处理
摘要
YourTTS 将多语言方法的强大能力引入零样本多说话人 TTS 任务。我们的方法构建于 VITS 模型之上,并添加了若干用于零样本多说话人和多语言训练的新颖改进。我们在零样本多说话人 TTS 上取得了最先进(SOTA)结果,并在 VCTK 数据集上的零样本语音转换中取得了与 SOTA 相当的结果。此外,我们的方法在仅含单说话人数据集的目标语言中取得了有前景的结果,为低资源语言中的零样本多说话人 TTS 和零样本语音转换系统开辟了可能。最后,可以用少于 1 分钟的语音对 YourTTS 模型进行微调,并在语音相似度上取得最先进结果且质量合理。这对于允许为训练期间所见声音或录音特性差异很大的说话人合成语音十分重要。
引用
@article{arxiv.2112.02418,
title = {YourTTS: Towards Zero-Shot Multi-Speaker TTS and Zero-Shot Voice Conversion for everyone},
author = {Edresson Casanova and Julian Weber and Christopher Shulby and Arnaldo Candido Junior and Eren Gölge and Moacir Antonelli Ponti},
journal= {arXiv preprint arXiv:2112.02418},
year = {2023}
}
备注
An Erratum was added on the last page of this paper