利用大语言模型缓解音视频语音识别中的注意力汇聚与大规模激活
音频与语音处理
2026-01-28 v3 计算机视觉与模式识别
声音
摘要
大语言模型(LLM)近期在听觉语音识别(ASR)、视觉语音识别(VSR)和音视频语音识别(AVSR)方面取得了进展。然而,对其在微调过程中内部动态的理解仍然有限。在自然语言处理中,近期研究揭示了注意力汇聚(即吸引异常高注意力的标记)以及相关的大规模激活(即汇聚标记的某些特征在LLM中表现出巨大激活)。在这项工作中,我们首次在多模态语音识别中研究这些现象。通过对音视频LLM的详细分析,我们不仅在BOS标记处,还在ASR、VSR和AVSR中的中间低语义标记处识别出注意力汇聚和大规模激活。我们表明,大规模激活源于MLP层,并对应于所有汇聚标记中固定的特征索引。我们进一步表明,中间汇聚标记与BOS标记表现出高余弦相似度,从而放大了注意力和激活。基于这些见解,我们引入了一个简单的去相关损失,降低了BOS与其他标记之间的余弦相似度,有效缓解了中间汇聚和大规模激活。此外,我们的方法在高音视频特征下采样率下改善了词错误率(WER),同时在较低下采样率下保持稳定。
引用
@article{arxiv.2510.22603,
title = {Mitigating Attention Sinks and Massive Activations in Audio-Visual Speech Recognition with LLMs},
author = {Anand and Umberto Cappellazzo and Stavros Petridis and Maja Pantic},
journal= {arXiv preprint arXiv:2510.22603},
year = {2026}
}
备注
IEEE ICASSP 2026. The code is available at https://github.com/umbertocappellazzo/Llama-AVSR