中文

SANE-TTS:稳定自然的端到端多语言文本到语音合成

音频与语音处理 2022-09-28 v1 机器学习

摘要

本文提出SANE-TTS,一种稳定自然的端到端多语言TTS模型。由于难以获取给定说话人的多语言语料,使用单语语料训练多语言TTS模型不可避免。我们引入了说话人正则化损失,可改善跨语言合成中的语音自然度,以及在其他多语言TTS模型中已应用的域对抗训练。此外,通过添加说话人正则化损失,在时长预测器中以零向量替换说话人嵌入,可稳定跨语言推理。借助该替换,我们的模型在跨语言合成中生成节奏适中的语音,而不受源说话人影响。在MOS评估中,SANE-TTS在跨语言与语内合成中自然度得分均超3.80,而真值得分为3.99。同时,SANE-TTS即使在跨语言推理中也保持接近真值的说话人相似度。音频样本发布于我们的网页。

关键词

引用

@article{arxiv.2206.12132,
  title  = {SANE-TTS: Stable And Natural End-to-End Multilingual Text-to-Speech},
  author = {Hyunjae Cho and Wonbin Jung and Junhyeok Lee and Sang Hoon Woo},
  journal= {arXiv preprint arXiv:2206.12132},
  year   = {2022}
}

备注

Accepted to Interspeech 2022