中文

一种更优且更快的流式 ASR 端到端模型

音频与语音处理 2021-02-12 v2 声音

摘要

端到端(E2E)模型已被证明在诸多方面优于最先进的传统流式语音识别模型 [1],包括质量(以词错误率(WER)衡量)与端点延迟 [2]。然而,该模型仍倾向于将预测推迟到末尾,因此相比传统 ASR 模型具有更高的部分延迟。为解决此问题,我们着眼于通过一种称为 FastEmit [3] 的算法鼓励 E2E 模型尽早发出词。自然地,改善延迟会导致质量下降。为此,我们探索用 Conformer 层 [4] 替换 E2E 模型编码器中的 LSTM 层,其已显示出对 ASR 的良好改进。其次,我们也探索运行第二遍束搜索以提升质量。为确保第二遍快速完成,我们探索了非因果 Conformer 层接入同一个第一遍 RNN-T 解码器,该算法称为 Cascaded Encoders [5]。总体而言,我们发现带有 Cascaded Encoders 的 Conformer RNN-T 为流式 ASR 提供了更好的质量与延迟权衡。

关键词

引用

@article{arxiv.2011.10798,
  title  = {A Better and Faster End-to-End Model for Streaming ASR},
  author = {Bo Li and Anmol Gulati and Jiahui Yu and Tara N. Sainath and Chung-Cheng Chiu and Arun Narayanan and Shuo-Yiin Chang and Ruoming Pang and Yanzhang He and James Qin and Wei Han and Qiao Liang and Yu Zhang and Trevor Strohman and Yonghui Wu},
  journal= {arXiv preprint arXiv:2011.10798},
  year   = {2021}
}

备注

Accepted in ICASSP 2021