基于 Listen, Attend and Spell 模型的在线自动语音识别
音频与语音处理
2020-12-02 v2 计算与语言
声音
摘要
Listen, Attend and Spell (LAS) 模型及其他基于注意力的自动语音识别 (ASR) 模型在完全在线模式下运行时存在已知的局限性。本文分析了 LAS 模型的在线运行,表明这些局限性源于对静音区域的处理以及输入缓冲区边缘处在线注意力机制的可靠性。我们提出了一种新颖且简单的技术,能够在满足准确率和延迟目标的同时实现完全在线识别。对于普通话听写任务,我们提出的方法在在线运行时的字符错误率相对于离线 LAS 模型在 4% 以内。所提出的在线 LAS 模型相对于精度相当的传统神经网络隐马尔可夫模型混合系统延迟降低了 12%。我们通过生产规模的部署验证了所提出的方法,据我们所知,这是完全在线 LAS 模型的首次此类部署。
引用
@article{arxiv.2008.05514,
title = {Online Automatic Speech Recognition with Listen, Attend and Spell Model},
author = {Roger Hsiao and Dogan Can and Tim Ng and Ruchir Travadi and Arnab Ghoshal},
journal= {arXiv preprint arXiv:2008.05514},
year = {2020}
}
备注
5 pages, 4 figures, this version is submitted to IEEE Signal Processing Letters