用于语音识别的快速且精确的循环神经网络声学模型
计算与语言
2015-07-27 v1 机器学习
神经与进化计算
机器学习
摘要
我们最近展示了,作为语音识别的声学模型,深度长短期记忆(LSTM)循环神经网络(RNN)优于前馈深度神经网络(DNN)。我们最近还展示了,使用此类 LSTM RNN 的序列训练上下文相关(CD)隐马尔可夫模型(HMM)声学模型的性能,可以通过以连接时序分类(CTC)初始化的序列训练音素模型来达到同等水平。在本文中,我们提出了进一步改进大词汇量语音识别 LSTM RNN 声学模型性能的技术。我们表明,帧堆叠和降低帧率能带来更精确的模型和更快的解码。CD 音素建模带来了进一步的改进。我们还展示了直接输出单词的 LSTM RNN 模型的初步结果。
引用
@article{arxiv.1507.06947,
title = {Fast and Accurate Recurrent Neural Network Acoustic Models for Speech Recognition},
author = {Haşim Sak and Andrew Senior and Kanishka Rao and Françoise Beaufays},
journal= {arXiv preprint arXiv:1507.06947},
year = {2015}
}
备注
To be published in the INTERSPEECH 2015 proceedings