中文

用于在线端到端语音识别的流式分块感知多头注意力

声音 2020-06-03 v1 音频与语音处理

摘要

近来,流式端到端自动语音识别(E2E-ASR)获得越来越多关注。已有诸多努力将非流式基于注意力的E2E-ASR系统转为流式架构。本工作中,我们提出一种新颖在线E2E-ASR系统,采用流式分块感知多头注意力(SCAMA)与配备延迟控制记忆的自注意力网络(LC-SAN-M)。LC-SAN-M使用分块级输入以控制编码器延迟。至于SCAMA,联合训练的预测器用于控制编码器输出至解码器时的馈送,使解码器能以流式方式生成输出。在开放170小时AISHELL-1与工业级20000小时普通话语音识别任务上的实验结果表明,在可比设置下我们的方法可显著优于基于MoChA的基线系统。在AISHELL-1任务上,我们提出的方法取得7.39%的字错误率(CER),据我们所知,这是在线ASR已发表的最佳性能。

关键词

引用

@article{arxiv.2006.01712,
  title  = {Streaming Chunk-Aware Multihead Attention for Online End-to-End Speech Recognition},
  author = {Shiliang Zhang and Zhifu Gao and Haoneng Luo and Ming Lei and Jie Gao and Zhijie Yan and Lei Xie},
  journal= {arXiv preprint arXiv:2006.01712},
  year   = {2020}
}

备注

submitted to INTERSPEECH2020