何时汇点有益或有害:大型视觉-语言模型中注意力汇点的统一框架
计算机视觉与模式识别
2026-04-07 v1
摘要
注意力汇点被定义为吸引不成比例注意力的标记。虽然这些已在单模态 Transformer 中得到研究,但它们在大型视觉-语言模型(LVLM)中的跨模态影响在很大程度上仍未被探索:它们是冗余的伪影还是必要的全局先验?本文首先将视觉汇点分为两个不同类别:从视觉编码器传播而来的 ViT 涌现汇点(V-sinks),以及在深层 LLM 层中出现的 LLM 涌现汇点(L-sinks)。基于这一新定义,我们的分析揭示了一个基本的性能权衡:虽然汇点有效地编码了全局场景级先验,但它们的主导地位会抑制局部感知所需的细粒度视觉证据。此外,我们确定了特定的功能层,在这些层中调节这些汇点对下游性能影响最为显著。为了利用这些见解,我们提出了逐层汇点门控(LSG),这是一个轻量级、即插即用的模块,可以动态缩放 V-sink 和其他视觉标记的注意力贡献。LSG 通过标准的下一标记预测进行训练,无需特定任务的监督,同时保持 LVLM 骨干网络冻结。在大多数层中,LSG 在代表性的多模态基准上带来了性能提升,有效地平衡了全局推理和精确的局部证据。
引用
@article{arxiv.2604.03316,
title = {When Sinks Help or Hurt: Unified Framework for Attention Sink in Large Vision-Language Models},
author = {Jiho Choi and Jaemin Kim and Sanghwan Kim and Seunghoon Hong and Jin-Hwi Park},
journal= {arXiv preprint arXiv:2604.03316},
year = {2026}
}
备注
preprint