SummaryMixing:一种用于语音识别与理解的线性复杂度自注意力替代方案
计算与语言
2024-07-12 v3 声音
音频与语音处理
摘要
现代语音处理系统依赖自注意力。遗憾的是,利用自注意力进行词符混合在语音话语长度上耗时平方级,拖慢了推理与训练并增加了内存消耗。已有针对 ASR 的自注意力廉价替代方案被开发出来,但未能稳定达到同等准确率。因此,本文提出一种新颖的线性时间自注意力替代方案。它通过对所有时间步的向量取均值来概括话语。随后将该单一摘要与特定时间信息相结合。我们称此方法为“SummaryMixing”。在最先进 ASR 模型中引入 SummaryMixing,可在使训练与推理提速高达 28% 并将内存使用减半的同时,保持或超越以往的语音识别性能。
引用
@article{arxiv.2307.07421,
title = {SummaryMixing: A Linear-Complexity Alternative to Self-Attention for Speech Recognition and Understanding},
author = {Titouan Parcollet and Rogier van Dalen and Shucong Zhang and Sourav Bhattacharya},
journal= {arXiv preprint arXiv:2307.07421},
year = {2024}
}
备注
Interspeech 2024