看见却不信任:探究视觉注意力与视觉语言模型答案正确性之间的断层
人工智能
2025-10-21 v1 计算机视觉与模式识别
摘要
视觉语言模型 (VLM) 在视觉问答等多模态任务上取得了强大的成绩,但即使正确的视觉证据存在时仍可能失败。本文系统性地研究这些失败是源于未能感知证据,还是源于未能有效利用证据。通过检查层级注意力动力学,我们发现浅层注意力主要聚焦于文本,而深层注意力稀疏但可靠地关注局部化证据区域。令人惊讶的是,VLM 在输出错误答案时仍常能感知视觉证据,我们称之为"看见却不信任",该现象在主要 VLM 系列中广泛存在。基于此,我们引入一种推理时干预方法,通过选择性注意力基掩码突出显示深层证据区域。该方法无需训练,能在 LLaVA、Qwen、Gemma 和 InternVL 等多个模型系列中持续提高准确率。这些结果表明,VLM 内部编码了可靠的证据,但未充分利用它,使此类信号显式化可弥合感知与推理之间的鸿沟,推动了对 VLM 的诊断性理解和可靠性。
引用
@article{arxiv.2510.17771,
title = {Seeing but Not Believing: Probing the Disconnect Between Visual Attention and Answer Correctness in VLMs},
author = {Zhining Liu and Ziyi Chen and Hui Liu and Chen Luo and Xianfeng Tang and Suhang Wang and Joy Zeng and Zhenwei Dai and Zhan Shi and Tianxin Wei and Benoit Dumoulin and Hanghang Tong},
journal= {arXiv preprint arXiv:2510.17771},
year = {2025}
}
备注
21 pages, 10 figures, 6 tables