一种更优且更快的流式 ASR 端到端模型
音频与语音处理
2021-02-12 v2 声音
摘要
端到端(E2E)模型已被证明在诸多方面优于最先进的传统流式语音识别模型 [1],包括质量(以词错误率(WER)衡量)与端点延迟 [2]。然而,该模型仍倾向于将预测推迟到末尾,因此相比传统 ASR 模型具有更高的部分延迟。为解决此问题,我们着眼于通过一种称为 FastEmit [3] 的算法鼓励 E2E 模型尽早发出词。自然地,改善延迟会导致质量下降。为此,我们探索用 Conformer 层 [4] 替换 E2E 模型编码器中的 LSTM 层,其已显示出对 ASR 的良好改进。其次,我们也探索运行第二遍束搜索以提升质量。为确保第二遍快速完成,我们探索了非因果 Conformer 层接入同一个第一遍 RNN-T 解码器,该算法称为 Cascaded Encoders [5]。总体而言,我们发现带有 Cascaded Encoders 的 Conformer RNN-T 为流式 ASR 提供了更好的质量与延迟权衡。
引用
@article{arxiv.2011.10798,
title = {A Better and Faster End-to-End Model for Streaming ASR},
author = {Bo Li and Anmol Gulati and Jiahui Yu and Tara N. Sainath and Chung-Cheng Chiu and Arun Narayanan and Shuo-Yiin Chang and Ruoming Pang and Yanzhang He and James Qin and Wei Han and Qiao Liang and Yu Zhang and Trevor Strohman and Yonghui Wu},
journal= {arXiv preprint arXiv:2011.10798},
year = {2021}
}
备注
Accepted in ICASSP 2021