中文

SpeedySpeech:高效神经语音合成

音频与语音处理 2020-08-11 v1 计算与语言 机器学习 声音

摘要

尽管近期的神经序列到序列模型大幅提升了语音合成质量,但尚无系统能够同时具备快速训练、快速推理和高质量音频合成的能力。我们提出了一种师生网络,能够实现高质量、快于实时的频谱图合成,对计算资源需求低且训练时间短。我们表明,自注意力层对于生成高质量音频并非必要。我们在学生和教师网络中均使用带残差连接的简单卷积块,并仅在教师模型中使用单一注意力层。配合 MelGAN 声码器,我们模型的语音质量被评定为显著优于 Tacotron 2。我们的模型可在单个 GPU 上高效训练,甚至能在 CPU 上实时运行。我们在 GitHub 仓库中提供了源代码和音频样本。

关键词

引用

@article{arxiv.2008.03802,
  title  = {SpeedySpeech: Efficient Neural Speech Synthesis},
  author = {Jan Vainer and Ondřej Dušek},
  journal= {arXiv preprint arXiv:2008.03802},
  year   = {2020}
}

备注

5 pages, 3 figures, Interspeech 2020