中文

通过相邻词元合并加速 Transducer

计算与语言 2023-06-29 v1 音频与语音处理 信号处理

摘要

近期端到端自动语音识别(ASR)系统常采用基于 Transformer 的声学编码器,以高帧率生成嵌入表示。然而,由于自注意力的二次计算复杂度,该设计效率低下,尤其对于长语音信号。为此,我们提出一种新方法——相邻词元合并(A-ToMe),逐步合并键值间相似度得分高的相邻词元。由此可减少总时间步,并加速编码器与联合网络的推理。在 LibriSpeech 上的实验表明,我们的方法可减少 57% 的词元,并在 GPU 上提升 70% 的推理速度,且精度无明显损失。此外,我们证明 A-ToMe 也是减少长格式 ASR 中词元数的有效方案,其中输入语音由多个语句组成。

关键词

引用

@article{arxiv.2306.16009,
  title  = {Accelerating Transducers through Adjacent Token Merging},
  author = {Yuang Li and Yu Wu and Jinyu Li and Shujie Liu},
  journal= {arXiv preprint arXiv:2306.16009},
  year   = {2023}
}

备注

Interspeech 2023