中文

用于移动设备的快速、紧凑且高质量的基于 LSTM-RNN 的统计参数语音合成器

声音 2016-06-23 v2 计算与语言

摘要

基于长短期记忆递归神经网络(LSTM-RNN)的声学模型已被应用于统计参数语音合成(SPSS),并在自然度和延迟方面显示出优于基于隐马尔可夫模型(HMM)的声学模型的显著改进。本文描述了基于 LSTM-RNN 的 SPSS 在移动设备上部署的进一步优化:权重量化、多帧推理以及使用 ϵ\epsilon 污染高斯损失函数的鲁棒推理。主观听力测试中的实验结果表明,这些优化可以使基于 LSTM-RNN 的 SPSS 在运行速度上与基于 HMM 的 SPSS 相当,同时保持自然度。此外,还展示了基于 LSTM-RNN 的 SPSS 与 HMM 驱动的单元选择语音合成之间的评估结果。

关键词

引用

@article{arxiv.1606.06061,
  title  = {Fast, Compact, and High Quality LSTM-RNN Based Statistical Parametric Speech Synthesizers for Mobile Devices},
  author = {Heiga Zen and Yannis Agiomyrgiannakis and Niels Egberts and Fergus Henderson and Przemysław Szczepaniak},
  journal= {arXiv preprint arXiv:1606.06061},
  year   = {2016}
}

备注

13 pages, 3 figures, Interspeech 2016 (accepted)