中文

从室内到开放世界:揭示 MLLMs 中的空间推理差距

计算机视觉与模式识别 2025-12-30 v2

摘要

尽管多模态大语言模型(MLLMs)在语义任务上取得了令人瞩目的性能,但其空间智力——对于稳健且具 grounding 能力的 AI 系统至关重要——仍未得到充分发展。现有基准测试不足以诊断这一局限:它们要么聚焦于过于简化的定性推理,要么依赖于特定领域的室内数据,受限于缺乏带有可验证度量基准的户外数据集。为弥合这一差距,我们引入了一个大规模基准数据集,源自使用同步立体相机、LiDAR 和 IMU/GPS 传感器捕获的行人视角视频。这一数据集提供了度量精确的 3D 信息,使我们能够自动生成涵盖层次化 spectrum——从定性关系推理到定量度量和运动学理解的空间推理问题。评估结果表明,结构化室内基准中观察到的性能提升在开放世界环境中消失。进一步的分析通过合成异常场景和盲测测试确认,当前 MLLMs 严重依赖语言先验,而非基于 grounding 的视觉推理。因此,我们的基准为诊断这些局限性并推动具物理 grounding 空间智力提供了原则性平台。

关键词

引用

@article{arxiv.2512.19683,
  title  = {From Indoor to Open World: Revealing the Spatial Reasoning Gap in MLLMs},
  author = {Mingrui Wu and Zhaozhi Wang and Fangjinhua Wang and Jiaolong Yang and Marc Pollefeys and Tong Zhang},
  journal= {arXiv preprint arXiv:2512.19683},
  year   = {2025}
}

备注

Project page: https://mingrui-wu.github.io/openbench/