中文

用于在线语音识别的单向记忆自注意力转导器

音频与语音处理 2021-02-24 v1 声音

摘要

自注意力模型已成功应用于端到端语音识别系统,大幅提升了识别准确率。然而,此类基于注意力的模型无法用于在线语音识别,因为它们通常须将整段声学序列作为 inputs。一种常见方法是用固定的左右窗口限制注意力视野,这使计算开销可控但也带来了性能下降。本文中,我们提出记忆自注意力 (MSA),将历史信息加入受限自注意力单元。MSA 仅需局部时间特征作为输入,并通过关注记忆状态高效建模长时上下文。同时,循环神经网络转导器 (RNN-T) 已被证明是在线 ASR 任务的优异方案,因为 RNN-T 的对齐是局部且单调的。我们提出一种称为记忆自注意力 (MSA) 转导器的新型网络结构。MSA 转导器的编码器与解码器均包含所提出的 MSA 单元。实验表明,我们提出的模型在 WSJ 和 SWBD 数据集上相对受限自注意力模型的 WER 结果分别改善了 13.5% 与 7.1%,且计算开销增加不多。

关键词

引用

@article{arxiv.2102.11594,
  title  = {Unidirectional Memory-Self-Attention Transducer for Online Speech Recognition},
  author = {Jian Luo and Jianzong Wang and Ning Cheng and Jing Xiao},
  journal= {arXiv preprint arXiv:2102.11594},
  year   = {2021}
}

备注

Accepted to ICASSP 2021