Flowtron:一种用于文本到语音合成的自回归基于流的生成网络
声音
2020-07-17 v3 计算与语言
机器学习
音频与语音处理
摘要
在本文中我们提出Flowtron:一种用于文本到语音合成的自回归基于流的生成网络,可控制语音变化与风格迁移。Flowtron借鉴IAF的洞见并改进Tacotron,以提供高质量且富有表现力的梅尔频谱图合成。Flowtron通过最大化训练数据的似然来进行优化,这使得训练简单且稳定。Flowtron学习数据到潜空间的可逆映射,该映射可被操控以控制语音合成的许多方面(音高、语调、语速、节奏、口音)。我们的平均意见得分(MOS)表明Flowtron在语音质量上可与最先进的TTS模型匹敌。此外,我们给出了关于语音变化控制、样本间插值以及训练时见过与未见过说话人之间风格迁移的结果。代码与预训练模型将在 https://github.com/NVIDIA/flowtron 公开提供。
引用
@article{arxiv.2005.05957,
title = {Flowtron: an Autoregressive Flow-based Generative Network for Text-to-Speech Synthesis},
author = {Rafael Valle and Kevin Shih and Ryan Prenger and Bryan Catanzaro},
journal= {arXiv preprint arXiv:2005.05957},
year = {2020}
}
备注
10 pages, 7 pictures