语音识别声学建模中深度双向 LSTM RNN 的综合研究
神经与进化计算
2019-08-06 v2 计算与语言
机器学习
声音
摘要
我们对用于自动语音识别(ASR)的基于深度双向长短期记忆(LSTM)递归神经网络(RNN)的声学模型进行了综合研究。我们研究了模型大小和深度的影响,并训练了多达 8 层的模型。我们研究了训练方面的问题,包括优化方法的不同变体、批处理、截断反向传播、诸如 dropout 和 正则化等不同正则化技术,以及不同的梯度裁剪变体。实验分析的主要部分在 Quaero 语料库上进行。另外在 Switchboard 语料库上进行了补充实验。在 Quaero 任务上,我们最佳的 LSTM 模型相较于最佳的前馈神经网络(FFNN)基线,词错率相对降低了 14\% 以上。在该任务上,我们使用 8 层双向 LSTM 获得了最佳结果,并且表明逐层构造的预训练方案对深度 LSTM 有所帮助。最后,我们比较了许多所提实验的训练计算时间与识别性能的关系。所有实验均使用 RETURNN(RWTH 通用递归神经网络可扩展训练框架)结合 RASR(RWTH ASR 工具包)完成。
引用
@article{arxiv.1606.06871,
title = {A Comprehensive Study of Deep Bidirectional LSTM RNNs for Acoustic Modeling in Speech Recognition},
author = {Albert Zeyer and Patrick Doetsch and Paul Voigtlaender and Ralf Schlüter and Hermann Ney},
journal= {arXiv preprint arXiv:1606.06871},
year = {2019}
}
备注
published on ICASSP 2017 conference, New Orleans, USA