中文

一种基于 GAN 的端到端 TTS 训练新算法

计算与语言 2019-04-10 v1 机器学习 声音

摘要

基于端到端自回归模型的 TTS(文本转语音)相较传统方法已显示出显著性能提升。然而,自回归模块训练受到暴露偏差或真实与预测数据不同分布间失配的影响。训练中真实数据可用,但测试中仅有预测数据可馈入自回归模块。通过在训练中同时引入真实与生成的数据序列,我们可缓解暴露偏差的影响。我们提出在训练中沿用了 Professor Forcing 核心思想并使用生成对抗网络(GAN)。GAN 中的判别器被联合训练以均衡真实与预测数据间的差异。在 AB 主观听力测试中,结果显示新方法有别于标准迁移学习,其 CMOS 改善达 0.1 而更受偏好。句子级可懂度测试在病理测试集上显示显著改善。经 GAN 训练的新模型也比基线更稳定,从而为 Tacotron 输出产生更好的对齐。

关键词

引用

@article{arxiv.1904.04775,
  title  = {A New GAN-based End-to-End TTS Training Algorithm},
  author = {Haohan Guo and Frank K. Soong and Lei He and Lei Xie},
  journal= {arXiv preprint arXiv:1904.04775},
  year   = {2019}
}

备注

Submitted to Interspeech 2019, Graz, Austria