中文

超越局部化:从全景图像评估多模态大语言模型(MLLM)的视角条件空间推理

计算机视觉与模式识别 2026-05-19 v3

摘要

多模态大语言模型(MLLM)在视觉感知方面表现出色,但在视点变化下的空间推理方面仍受限。我们将这一挑战定义为视角条件空间推理(Perspective-Conditioned Spatial Reasoning, PCSR),其在360度全景图像中进行,由于广泛的场景覆盖减少了部分观察的歧义,但仍需基于视点的推理。为评估这一能力,我们引入PCSR-Bench,该诊断基准包含来自26个室内环境的84,373个问答对,基于2,600张全景图像。PCSR-Bench涵盖八个任务,包括基础感知(如对象计数、相对距离和相对方向)以及高级PCSR,包括组成性链、站立姿态旋转、视角重新锚定、主体畸变和有限视野可见性。我们评估了14个代表性MLLM,观察到显著的感知-推理鸿沟:在基础相对方向上准确率达到57.59%,但在站立姿态旋转上降至13.49%,站立畸变上降至7.13%,开放性组成推理上降至0.64%。为探讨这一鸿沟的可塑性,我们对7B规模模型进行基于强化学习的诊断研究。在受控环境下,奖励引导将匹配的7B基线模型从31.10%提升至60.06%,表明PCSR具有部分可塑性而非完全不可逆。尽管如此,提升仍具有任务选择性,对奖励设计(包括权重分配和奖励形式)敏感,部分取决于评估协议。这些结果将PCSR定位为当前MLLM的关键瓶颈,并突显在有针对性优化下仍有有限但有意义的恢复空间。

关键词

引用

@article{arxiv.2605.12413,
  title  = {Beyond Localization: A Comprehensive Diagnosis of Perspective-Conditioned Spatial Reasoning in MLLMs from Omnidirectional Images},
  author = {Yuangong Chen and Wai Keung Wong and Jiaxing Li and Ioannis Patras and Xu Zheng},
  journal= {arXiv preprint arXiv:2605.12413},
  year   = {2026}
}

备注

10pages, 4 figures