中文

基于 Transformer 的流式 ASR 与累积注意力

音频与语音处理 2022-03-14 v1 声音

摘要

本文提出一种在线注意力机制,称为累积注意力(CA),用于基于 Transformer 的流式自动语音识别(ASR)。受单调分块注意力(MoChA)与头同步解码器端自适应计算步数(HS-DACS)算法启发,CA 根据每个编码时间步累积的声学信息触发 ASR 输出,其中决策由称为停止选择器(halting selector)的可训练装置做出。在 CA 中,同一解码器层的所有注意力头被同步以具有统一的停止位置。该特性有效缓解了各头行为差异导致的问题,否则可能如 MoChA 那样引发严重的延迟问题。在 AIShell-1 与 Librispeech 数据集上进行的 ASR 实验表明,与其他文献中的流式 Transformer 系统相比,所提出的基于 CA 的 Transformer 系统在推理时延迟显著降低,且性能相当或更优。

关键词

引用

@article{arxiv.2203.05736,
  title  = {Transformer-based Streaming ASR with Cumulative Attention},
  author = {Mohan Li and Shucong Zhang and Catalin Zorila and Rama Doddipatla},
  journal= {arXiv preprint arXiv:2203.05736},
  year   = {2022}
}

备注

5 pages, 1 figure, accepted at ICASSP 2022