中文

残差LSTM:用于远距离语音识别的深度循环神经网络架构设计

机器学习 2017-06-07 v3 人工智能 声音

摘要

本文提出了一种深度循环神经网络的新架构——残差LSTM (Residual LSTM)。普通的LSTM具有内部记忆单元,可学习序列数据的长期依赖关系,并提供时间捷径路径以避免时间域中的梯度消失或爆炸。残差LSTM提供了从较低层的额外空间捷径路径,用于高效训练具有多个LSTM层的深度网络。与先前的工作高速LSTM (highway LSTM) 相比,残差LSTM利用输出层将空间捷径路径与时间路径分离,有助于避免空间与时间域梯度流之间的冲突。此外,残差LSTM复用LSTM的输出投影矩阵和输出门来控制空间信息流,而非额外的门控网络,从而有效减少了超过10%的网络参数。在AMI SDM语料库上的远距离语音识别实验表明,10层普通和高速LSTM网络分别比3层基线的词错误率(WER)增加了13.7%和6.2%。相反,10层残差LSTM网络提供了最低的WER 41.0%,相对于普通和高速LSTM网络分别降低了3.3%和2.8%的WER。

关键词

引用

@article{arxiv.1701.03360,
  title  = {Residual LSTM: Design of a Deep Recurrent Architecture for Distant Speech Recognition},
  author = {Jaeyoung Kim and Mostafa El-Khamy and Jungwon Lee},
  journal= {arXiv preprint arXiv:1701.03360},
  year   = {2017}
}