VERA:识别并利用视觉证据检索头以提升长文本理解
计算机视觉与模式识别
2026-02-12 v1 计算与语言
摘要
虽然视觉语言模型(Vision-Language Models, VLMs)在文本理解方面表现出前景,但在处理长上下文和复杂推理任务时面临重大挑战。本文通过注意力分析视角,剖析了VLMs内部长上下文处理机制的运行逻辑,以识别其性能瓶颈。我们发现,存在一组特定的视觉证据检索(Visual Evidence Retrieval, VER)头——稀疏且动态的注意力头,对定位推理中的视觉线索至关重要,这些头与静态OCR头不同。我们证明了这些头对模型性能具有因果关系;遮蔽后会导致显著性能下降。基于此发现,我们提出了VERA(Visual Evidence Retrieval Augmentation,视觉证据检索增强),一个无需训练的框架,通过检测模型不确定性(即熵)来触发对VER头所关注的视觉证据的显式语言化。广泛实验表明,VERA显著提升了开源VLMs的长上下文理解能力:在五个基准测试中,Qwen3-VL-8B-Instruct平均相对提升21.3%,GLM-4.1V-Thinking提升20.1%。
引用
@article{arxiv.2602.10146,
title = {VERA: Identifying and Leveraging Visual Evidence Retrieval Heads in Long-Context Understanding},
author = {Rongcan Pei and Huan Li and Fang Guo and Qi Zhu},
journal= {arXiv preprint arXiv:2602.10146},
year = {2026}
}
备注
12 pages, 12 figures