大型多模态模型中的视觉注意力汇 sink
计算机视觉与模式识别
2025-03-06 v1 人工智能
摘要
大型多模态模型(LMM)通过 transformer解码器中文本和视觉token之间的注意力机制来'看到'图像。理想情况下,这些模型应该聚焦于与文本token相关的关键视觉信息。然而,近期研究表明,LMM对特定视觉token具有极强的持续分配高注意力权重的倾向,即使这些token与相应文本无关。在本研究中,我们调查了这些无关视觉token出现的原因并检视其特征。我们的发现表明,这种行为源于对某些隐藏状态维度的大量激活,这类似于语言模型中发现的注意力 sink。因此,我们将这一现象称为视觉注意力 sink。特别地,我们的分析显示,删除这些无关的视觉 sink token不会影响模型性能,尽管它们接收到高注意力权重。因此,我们将这些token的注意力资源回收为盈余资源,将注意力预算重新分配以增强对图像的关注。为实现此目标,我们引入Visual Attention Redistribution(VAR),一种在图像中心head中重新分配注意力的方法,我们在那里识别出内在地聚焦于视觉信息的head。VAR可以无缝应用于不同LMM,以提高在广泛任务上的性能,包括常规视觉-语言任务、视觉幻觉任务和以视觉为中心的任务,无需额外训练、模型或推理步骤。实验结果表明,VAR使LMM能通过调整其内部注意力机制更有效地处理视觉信息,为增强LMM的多模态能力提供了新方向。
引用
@article{arxiv.2503.03321,
title = {See What You Are Told: Visual Attention Sink in Large Multimodal Models},
author = {Seil Kang and Jinyeong Kim and Junhyeok Kim and Seong Jae Hwang},
journal= {arXiv preprint arXiv:2503.03321},
year = {2025}
}