Deep Voice 3:利用卷积序列学习扩展文本到语音合成
声音
2018-02-23 v3 人工智能
计算与语言
机器学习
音频与语音处理
摘要
我们提出 Deep Voice 3,一种基于注意力机制的全卷积神经文本到语音(TTS)系统。Deep Voice 3 在自然度上与最先进的神经语音合成系统相当,同时训练速度快十倍。我们将 Deep Voice 3 扩展到 TTS 领域前所未有的数据集规模,使用来自超过两千名说话人的八百多小时音频进行训练。此外,我们识别了基于注意力的语音合成网络的常见错误模式,展示了如何缓解这些错误,并比较了几种不同的波形合成方法。我们还描述了如何在单个 GPU 服务器上将推理扩展到每日一千万次查询。
引用
@article{arxiv.1710.07654,
title = {Deep Voice 3: Scaling Text-to-Speech with Convolutional Sequence Learning},
author = {Wei Ping and Kainan Peng and Andrew Gibiansky and Sercan O. Arik and Ajay Kannan and Sharan Narang and Jonathan Raiman and John Miller},
journal= {arXiv preprint arXiv:1710.07654},
year = {2018}
}
备注
Published as a conference paper at ICLR 2018. (v3 changed paper title)