SpeedySpeech:高效神经语音合成
音频与语音处理
2020-08-11 v1 计算与语言
机器学习
声音
摘要
尽管近期的神经序列到序列模型大幅提升了语音合成质量,但尚无系统能够同时具备快速训练、快速推理和高质量音频合成的能力。我们提出了一种师生网络,能够实现高质量、快于实时的频谱图合成,对计算资源需求低且训练时间短。我们表明,自注意力层对于生成高质量音频并非必要。我们在学生和教师网络中均使用带残差连接的简单卷积块,并仅在教师模型中使用单一注意力层。配合 MelGAN 声码器,我们模型的语音质量被评定为显著优于 Tacotron 2。我们的模型可在单个 GPU 上高效训练,甚至能在 CPU 上实时运行。我们在 GitHub 仓库中提供了源代码和音频样本。
引用
@article{arxiv.2008.03802,
title = {SpeedySpeech: Efficient Neural Speech Synthesis},
author = {Jan Vainer and Ondřej Dušek},
journal= {arXiv preprint arXiv:2008.03802},
year = {2020}
}
备注
5 pages, 3 figures, Interspeech 2020