中文

SummaryMixing:一种用于语音识别与理解的线性复杂度自注意力替代方案

计算与语言 2024-07-12 v3 声音 音频与语音处理

摘要

现代语音处理系统依赖自注意力。遗憾的是,利用自注意力进行词符混合在语音话语长度上耗时平方级,拖慢了推理与训练并增加了内存消耗。已有针对 ASR 的自注意力廉价替代方案被开发出来,但未能稳定达到同等准确率。因此,本文提出一种新颖的线性时间自注意力替代方案。它通过对所有时间步的向量取均值来概括话语。随后将该单一摘要与特定时间信息相结合。我们称此方法为“SummaryMixing”。在最先进 ASR 模型中引入 SummaryMixing,可在使训练与推理提速高达 28% 并将内存使用减半的同时,保持或超越以往的语音识别性能。

关键词

引用

@article{arxiv.2307.07421,
  title  = {SummaryMixing: A Linear-Complexity Alternative to Self-Attention for Speech Recognition and Understanding},
  author = {Titouan Parcollet and Rogier van Dalen and Shucong Zhang and Sourav Bhattacharya},
  journal= {arXiv preprint arXiv:2307.07421},
  year   = {2024}
}

备注

Interspeech 2024