使用双向循环 DNN 进行首遍大词汇量连续语音识别
计算与语言
2014-12-09 v2 机器学习
神经与进化计算
摘要
我们提出了一种仅使用神经网络和语言模型进行首遍大词汇量连续语音识别的方法。深度神经网络声学模型现在在基于 HMM 的语音识别系统中很常见,但构建此类系统是一项复杂的、特定于领域的任务。最近的工作证明了通过直接从音频预测转录文本来丢弃 HMM 序列建模框架的可行性。本文从两个方面扩展了这一方法。首先,我们证明了一种简单的循环神经网络架构可以实现高水平的准确性。其次,我们提出并评估了一种改进的前缀搜索解码算法。这种解码方法实现了带有语言模型的首遍语音识别,完全无需基于 HMM 系统的繁琐基础设施。在《华尔街日报》语料库上的实验表明,该方法具有相当竞争力的词错误率,并证明了双向网络递归的重要性。
引用
@article{arxiv.1408.2873,
title = {First-Pass Large Vocabulary Continuous Speech Recognition using Bi-Directional Recurrent DNNs},
author = {Awni Y. Hannun and Andrew L. Maas and Daniel Jurafsky and Andrew Y. Ng},
journal= {arXiv preprint arXiv:1408.2873},
year = {2014}
}