数据缩减对序列到序列神经语音合成的影响
计算与语言
2018-11-26 v2 音频与语音处理
摘要
近期基于自回归神经网络模型采样的语音合成系统所生成的语音几乎与人类录音无法区分。然而,这些模型需要大量数据。本文表明,单一说话人数据的缺乏可由其他说话人的数据来弥补。在 7 个说话人各 5k 条语句混合数据上训练的 Tacotron2 类模型的自然度优于在 15k 条语句上训练的说话人相关模型,但在稳定性方面多说话人模型始终更为稳定。我们还证明,将目标说话人仅 1250 条语句与其余 6 个说话人共 5k 条语句混合训练的模型,其生成质量显著优于基于超过目标说话人数据 10 倍以上的最先进的 DNN 引导单元选择系统。
引用
@article{arxiv.1811.06315,
title = {Effect of data reduction on sequence-to-sequence neural TTS},
author = {Javier Latorre and Jakub Lachowicz and Jaime Lorenzo-Trueba and Thomas Merritt and Thomas Drugman and Srikanth Ronanki and Klimkov Viacheslav},
journal= {arXiv preprint arXiv:1811.06315},
year = {2018}
}
备注
4 pages, 1 extra for references. Submitted to ICASSP 2019