中文

迈向快速而准确的流式端到端 ASR

音频与语音处理 2020-05-14 v2

摘要

端到端(E2E)模型将传统语音识别模型的声学、发音和语言模型折叠为一个神经网络,其参数数量远少于传统 ASR 系统,因此适合设备端应用。例如,循环神经网络转导器(RNN-T)作为一种流式 E2E 模型,已在设备端 ASR 中展现出有前景的潜力。对于此类应用,质量和延迟是两个关键因素。我们提出通过扩展 RNN-T 端点器(RNN-T EP)模型并加入额外的早惩罚和晚惩罚来降低 E2E 模型的延迟。通过进一步应用最小词错误率(MWER)训练技术,我们在 Voice Search 测试集上实现了相对于原有模型 8.0% 的相对词错误率(WER)降低和 130ms 的 90 分位延迟降低。我们还尝试了第二遍 Listen, Attend and Spell (LAS) 重打分器。尽管它没有直接改善第一遍延迟,但较大的 WER 降低提供了以 WER 换取延迟的额外空间。RNN-T EP+LAS 结合 MWER 训练,相较于最初提出的 RNN-T EP 模型带来了 18.7% 的相对 WER 降低和 160ms 的 90 分位延迟降低。

关键词

引用

@article{arxiv.2004.11544,
  title  = {Towards Fast and Accurate Streaming End-to-End ASR},
  author = {Bo Li and Shuo-yiin Chang and Tara N. Sainath and Ruoming Pang and Yanzhang He and Trevor Strohman and Yonghui Wu},
  journal= {arXiv preprint arXiv:2004.11544},
  year   = {2020}
}

备注

Accepted in ICASSP 2020