中文

长上下文视觉语言模型中的检索头:图像可见性检验

计算机视觉与模式识别 2026-05-27 v1

摘要

大型视觉语言模型越来越依赖长上下文建模来推理文档、小时级视频和长期轨迹,需要它们跨越文本和图像交错的上下文中定位相关证据。先前的工作使用大型语言模型中的检索头来研究这种行为,但其基于复制的准则在证据出现于图像时不直接适用。我们引入一种多模态检索头检测方法,对问题标记到文本或视觉证据的注意力进行评分。通过该方法,我们表明多模态检索头稀疏、内在且具有因果重要性:仅4.4-10.2%的注意力头账户了50%的正检索得分,屏蔽前5%选定的注意力头将 MMLongBench-Doc 从48.2%下降到5.7%,将 SlideVQA 从71.2%下降到8.9%,而随机注意力头屏蔽则影响较小。进一步分析显示,这些头在模态之间部分共享,但在每个模态内保持动态,随着上下文长度和haystack模态变化,图像检索头的变化大于文本检索头。在无需进一步训练的情况下,我们发现这些头也可直接用于对视觉丰富文档进行排序:在 MMDocIR 上,Qwen3-VL-8B 选定-head 评分在页面检索和布局检索的 Recall@1 分别比最强报告的基线提高了7.7/7.4 和 6.3/6.8 个宏/微点。

关键词

引用

@article{arxiv.2605.27243,
  title  = {Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models},
  author = {Aaron Branson Cigres Li and Zhaowei Wang and Yu Zhao and Yiming Du and Haobo Li and Xiyu Ren and Ginny Wong and Simon See and Lishu Luo and Haodong Duan and Pasquale Minervini and Yangqiu Song},
  journal= {arXiv preprint arXiv:2605.27243},
  year   = {2026}
}

备注

Work in Progress