中文

一种用于语音识别的带无网格 MMI 的新型金字塔-FSMN 架构

声音 2018-11-01 v2 音频与语音处理

摘要

深度前馈序列记忆网络(DFSMN)在语音识别任务上已展现出优越性能。基于该工作,我们提出一种引入金字塔记忆结构以在不同层表示多种上下文信息的新型网络架构。此外,前端还添加了 res-CNN 层以提取更复杂的特征。结合无网格最大互信息(LF-MMI)与交叉熵(CE)联合训练准则,实验结果表明该方法在 Librispeech 与 LDC97S62 (Switchboard 300 小时) 语料上分别取得了 3.62% 与 10.89% 的词错误率(WERs)。进一步应用循环神经网络语言模型(RNNLM)重打分,在 Librispeech 上获得了 2.97% 的 WER。

关键词

引用

@article{arxiv.1810.11352,
  title  = {A novel pyramidal-FSMN architecture with lattice-free MMI for speech recognition},
  author = {Xuerui Yang and Jiwei Li and Xi Zhou},
  journal= {arXiv preprint arXiv:1810.11352},
  year   = {2018}
}

备注

5 pages, 3 figures, 2 tables. 2019 ICASSP submitted