中文

基于 Transformer 的流式 ASR 的头同步解码

音频与语音处理 2021-04-27 v1

摘要

由于流式应用需求的增长,基于在线 Transformer 的自动语音识别(ASR)系统已被广泛研究。近期提出的用于在线 Transformer ASR 的解码端自适应计算步数(DACS)算法被证明达到了最先进的性能,并优于其他现有方法。然而,与其他在线方法一样,Transformer 解码器各层中的 DACS 注意力头独立(或异步)运行,导致注意力位置发散。由于 DACS 采用截断阈值来确定停止位置,部分注意力权重被过早截断,可能影响解码的稳定性和精度。为克服这些问题,本文提出 DACS 算法的头同步(HS)版本,其中注意力边界由每层中所有 DACS 头联合检测。在 Wall Street Journal(WSJ)、AIShell-1 和 Librispeech 上的 ASR 实验表明,所提方法一致优于原始 DACS 并达到最先进性能。我们还将展示 HS-DACS 相较于原始 DACS 降低了解码代价。

关键词

引用

@article{arxiv.2104.12631,
  title  = {Head-synchronous Decoding for Transformer-based Streaming ASR},
  author = {Mohan Li and Catalin Zorila and Rama Doddipatla},
  journal= {arXiv preprint arXiv:2104.12631},
  year   = {2021}
}

备注

5 pages, 1 figure