超越主导性图块:面向 grounding 的视觉语言模型的空间信用重新分配
摘要
视觉语言模型(VLMs)常常在输入图像中不存在的对象上幻觉。我们识别了一个导致此行为的Contributing 原因,称为空间信用坍缩:在早期转换器层中,隐藏状态激活集中在少数几个视觉图块上,抑制周围的上下文证据并增加对语言先验的依赖。在七个模型中,我们观察到视觉注意力熵与幻觉率之间存在强相关性(r = -0.65, p < 0.001),这表明减少空间信用多样性是否Contributing 于幻觉。在解决此问题方面,我们提出了空间信用重新分配(SCR),一种训练-free 的推理时方法。SCR 使用轻量级的两 pass 程序。诊断 pass 识别 top-K 高注意力来源图块及其空间邻居。重新分配 pass 然后将每个来源按 1/lambda(约 0.91)比例缩放,并将其隐藏状态的 (lambda - 1) 加权副本注入邻居图块,恢复被抑制的视觉上下文而无需修改模型权重。由于诊断 pass 只在图像上执行一次并在输出序列中重用,添加的延迟可忽略不计(对于 100 token 的响应,每个 token <0.5 ms)。我们在七个模型配置(来自四个 VLM 系列:Chameleon、LLaVA-1.5、Qwen-VL/Qwen2-VL 和 InternVL2)上评估了 SCR,在五个基准测试上:POPE、CHAIR、MME、HallusionBench 和 AMBER。SCR 将 POPE-Adversarial 幻觉降低 4.6-6.0 个百分点,将 CHAIR-s 幻觉降低 41-51 percent,同时保持标题质量(CIDEr 下降 <=0.8)。与包括 OPERA、VCD、OA-VCD、DoLa、VLI、SID 和 CRoPS 在内的先前推理时方法相比,SCR 在幻觉降低、生成质量和延迟之间实现了更好的权衡。
引用
@article{arxiv.2602.22469,
title = {Beyond Dominant Patches: Spatial Credit Redistribution For Grounded Vision-Language Models},
author = {Niamul Hassan Samin and Md Arifur Rahman and Abdullah Ibne Hanif Arean and Juena Ahmed Noshin and Md Ashikur Rahman},
journal= {arXiv preprint arXiv:2602.22469},
year = {2026}
}