Deep Voice 2:多说话人神经文本到语音合成
计算与语言
2017-09-22 v2
摘要
我们引入一种技术,通过低维可训练说话人嵌入来增强神经文本到语音合成(TTS),使单一模型能够生成不同声音。作为起点,我们展示了相较于两种最先进的单说话人神经TTS方法——Deep Voice 1和Tacotron——的改进。我们推出Deep Voice 2,它基于与Deep Voice 1类似的流水线架构,但采用性能更高的构建模块,在音频质量上相较Deep Voice 1有显著提升。我们通过引入后处理神经声码器来改进Tacotron,并展示了音频质量的显著提升。随后,我们在两个多说话人TTS数据集上,针对Deep Voice 2和Tacotron展示了我们的多说话人语音合成技术。我们证明,单个神经TTS系统可以从每位说话人不足半小时的数据中学习数百种独特声音,同时实现高音频质量合成,并几乎完美地保留说话人身份。
引用
@article{arxiv.1705.08947,
title = {Deep Voice 2: Multi-Speaker Neural Text-to-Speech},
author = {Sercan Arik and Gregory Diamos and Andrew Gibiansky and John Miller and Kainan Peng and Wei Ping and Jonathan Raiman and Yanqi Zhou},
journal= {arXiv preprint arXiv:1705.08947},
year = {2017}
}
备注
Accepted in NIPS 2017