中文

两遍端到端语音识别

计算与语言 2019-08-30 v1 声音 音频与语音处理

摘要

许多最先进语音识别系统应用的需求不仅包括低词错率(WER),还包括低延迟。具体而言,对于许多用例,系统必须能够以流式方式解码语音且速度快于实时。近来,流式循环神经网络转导器(RNN-T)端到端(E2E)模型已被证明是设备端语音识别的良好候选,相较于传统设备端模型具有改进的WER与延迟指标[1]。然而,该模型在质量上仍落后于大型最先进传统模型[2]。另一方面,非流式E2E Listen, Attend and Spell(LAS)模型已显示出与大型传统模型相当的质量[3]。本工作旨在通过将LAS网络作为第二遍组件引入,同时仍遵守延迟约束,使E2E流式模型的质量接近传统系统。我们提出的两遍模型相较于单独RNN-T实现了17%–22%的WER相对降低,且仅比RNN-T增加极小部分延迟。

关键词

引用

@article{arxiv.1908.10992,
  title  = {Two-Pass End-to-End Speech Recognition},
  author = {Tara N. Sainath and Ruoming Pang and David Rybach and Yanzhang He and Rohit Prabhavalkar and Wei Li and Mirkó Visontai and Qiao Liang and Trevor Strohman and Yonghui Wu and Ian McGraw and Chung-Cheng Chiu},
  journal= {arXiv preprint arXiv:1908.10992},
  year   = {2019}
}