中文

Flowtron:一种用于文本到语音合成的自回归基于流的生成网络

声音 2020-07-17 v3 计算与语言 机器学习 音频与语音处理

摘要

在本文中我们提出Flowtron:一种用于文本到语音合成的自回归基于流的生成网络,可控制语音变化与风格迁移。Flowtron借鉴IAF的洞见并改进Tacotron,以提供高质量且富有表现力的梅尔频谱图合成。Flowtron通过最大化训练数据的似然来进行优化,这使得训练简单且稳定。Flowtron学习数据到潜空间的可逆映射,该映射可被操控以控制语音合成的许多方面(音高、语调、语速、节奏、口音)。我们的平均意见得分(MOS)表明Flowtron在语音质量上可与最先进的TTS模型匹敌。此外,我们给出了关于语音变化控制、样本间插值以及训练时见过与未见过说话人之间风格迁移的结果。代码与预训练模型将在 https://github.com/NVIDIA/flowtron 公开提供。

关键词

引用

@article{arxiv.2005.05957,
  title  = {Flowtron: an Autoregressive Flow-based Generative Network for Text-to-Speech Synthesis},
  author = {Rafael Valle and Kevin Shih and Ryan Prenger and Bryan Catanzaro},
  journal= {arXiv preprint arXiv:2005.05957},
  year   = {2020}
}

备注

10 pages, 7 pictures