面向流式ASR的基于非自回归插入式模型
音频与语音处理
2021-07-19 v2
摘要
神经端到端(E2E)模型已成为实现实用自动语音识别(ASR)系统的一种有前景的技术。在实现此类系统时,一个重要问题是音频的分段处理,以应对流式输入或长录音。音频分段后,具有较小实时因子(RTF)的ASR模型更受青睐,因为系统延迟可更低。近来,基于非自回归模型的E2E ASR成为一种有前景的方法,因为它能以少于次迭代解码长度为的令牌序列。我们提出一种将音频分段与非自回归ASR相拼接的系统,以实现高精度和低RTF的ASR。作为非自回归ASR,采用了基于插入的模型。此外,我们并非简单拼接分段与ASR的分离模型,而是引入一种新架构,通过单一神经网络实现音频分段与非自回归ASR。在日本语和英语数据集上的实验结果表明,与自回归基线Transformer和连接主义时序分类相比,该方法在精度与RTF之间取得了合理的权衡。
引用
@article{arxiv.2012.10128,
title = {Toward Streaming ASR with Non-Autoregressive Insertion-based Model},
author = {Yuya Fujita and Tianzi Wang and Shinji Watanabe and Motoi Omachi},
journal= {arXiv preprint arXiv:2012.10128},
year = {2021}
}