中文

WNARS:基于WFST的非自回归流式端到端语音识别

声音 2021-04-22 v2 计算与语言 音频与语音处理

摘要

近年来,基于注意力的编码器-解码器(AED)端到端(E2E)模型在自动语音识别(ASR)领域受到越来越多关注。然而,AED模型在部署到商业应用时仍存在缺陷。自回归束搜索解码使其在高并发应用中效率低下,且不便集成外部词级语言模型。最重要的是,由于全局注意力机制,AED模型难以进行流式识别。本文提出一种新框架WNARS,利用混合CTC-注意力AED模型与加权有限状态转换器(WFST)一并解决这些问题。我们将自回归束搜索切换为CTC分支解码,以分块流式方式通过WFST进行第一遍解码;解码器分支随后以非自回归方式对生成的假设进行第二遍重打分。在AISHELL-1任务上,我们的WNARS以640ms延迟实现了5.22%的字错误率,据我们所知,这是在线ASR的当前最优(state-of-the-art)性能。在10000小时中文任务上的进一步实验表明,与强基线TDNN-BLSTM无网格MMI相比,所提方法在延迟降低50%的同时取得了超过20%的提升。

关键词

引用

@article{arxiv.2104.03587,
  title  = {WNARS: WFST based Non-autoregressive Streaming End-to-End Speech Recognition},
  author = {Zhichao Wang and Wenwen Yang and Pan Zhou and Wei Chen},
  journal= {arXiv preprint arXiv:2104.03587},
  year   = {2021}
}