中文

为何 VLMs 在空间推理方面困难?基于注意力机制的焦点区域视角

计算与语言 2025-10-14 v3

摘要

大型视觉语言模型(VLMs)长期以来在空间推理任务中存在困难。令人惊讶的是,即使是仅包含两个对象之间“下”或“后”等简单空间推理任务,对当前 VLMs 也提出了显著挑战。本文从机制可解释性的视角研究空间推理挑战,深入检查模型的内部状态以检查图像和文本标记之间的相互作用。通过追踪注意力在中间层中的图像分布,我们观察到成功的空间推理与模型将注意力分布与实际对象位置对齐的能力密切相关,尤其是在熟悉和不熟悉空间关系之间存在差异。针对这些发现,我们提出了 ADAPTVIS 基于推理时置信度得分来锐化在置信度高时高度相关区域的注意力,同时在置信度较低时平滑和扩大注意力窗口以考虑更广阔的上下文。该无训练解码方法在诸如 WhatsUp 和 VSR 等空间推理基准测试中实现了显著改进(例如提升最高可达 50 分绝对值),且几乎没有额外开销。我们在 https://github.com/shiqichen17/AdaptVis 上公开代码和数据供研究人员使用。

关键词

引用

@article{arxiv.2503.01773,
  title  = {Why Is Spatial Reasoning Hard for VLMs? An Attention Mechanism Perspective on Focus Areas},
  author = {Shiqi Chen and Tongyao Zhu and Ruochen Zhou and Jinghan Zhang and Siyang Gao and Juan Carlos Niebles and Mor Geva and Junxian He and Jiajun Wu and Manling Li},
  journal= {arXiv preprint arXiv:2503.01773},
  year   = {2025}
}

备注

ICML 2025