中文

用于改善合成语音质量的LSTM深度神经网络后滤波

声音 2016-02-09 v1 神经与进化计算

摘要

语音合成的最新进展已产生能够输出可懂语音的系统,但如今研究者力求创建更精确模仿人声的模型。此类进展之一是在不同语言和口音中融入多种语言风格。基于HMM的语音合成因能以较小资源占用生成复杂特征而备受许多研究者关注。尽管取得上述进展,其质量尚未达到主流的单元选择方法(选取并拼接真实语音录音)的水平。近期已有改进这些系统的尝试。本文中,我们提出将长短期记忆(LSTM)深度神经网络作为基于HMM的语音合成的后滤波步骤,以获取更接近自然语音的频谱特征。结果表明了利用该方法可如何改善HMM语音。

关键词

引用

@article{arxiv.1602.02656,
  title  = {LSTM Deep Neural Networks Postfiltering for Improving the Quality of Synthetic Voices},
  author = {Marvin Coto-Jiménez and John Goddard-Close},
  journal= {arXiv preprint arXiv:1602.02656},
  year   = {2016}
}

备注

5 pages, 5 figures