中文

CREG:用于表征 VLM 空间推理归因中方向结构的 Compass 关系证据图

计算机视觉与模式识别 2026-04-15 v3

摘要

标准归因热力图显示视觉-语言模型 (VLM) 关注的区域,但不揭示恢复的证据是按查询的空间关系组织的还是仅仅反映图像布局。为解决此问题,我们引入 CREG (Compass Relational Evidence Graph),一个将 token 级归因转换为参考中心指向分布并衡量其方向对齐的训练-free 诊断框架。CREG 提供跨归因方法的统一方向读取,并使与几何控制的比较变得显式。在三个空间关系基准测试中,仅基于盒子的几何实现的方向对齐误差比当前基于模型的归因方法低超过 30 度,表明归因结构与简单目标定位之间存在显着差距。为检验此差距,我们应用包括目标干预、参考中心随机化和方差分区在内的诊断电池。综合结果表明,当前归因方法可恢复的方向结构受限且常常混合了图像布局。我们进一步发现,更高的任务准确性不一定与更好的方向归因一致:小规模的 LoRA 训练和更新的模型生成可提高任务准确性,但方向对齐误差不变甚至更差。这些发现刻画了当前归因方法揭示的内容,而非模型内部的空间表示。CREG 提供了一个受控的协议,用于测试空间推理的改进是否伴随更方向化的证据组织。

关键词

引用

@article{arxiv.2603.20475,
  title  = {CREG: Compass Relational Evidence Graph for Characterizing Directional Structure in VLM Spatial-Reasoning Attribution},
  author = {Kaizhen Tan and Yang Feng and Heqing Du},
  journal= {arXiv preprint arXiv:2603.20475},
  year   = {2026}
}