中文

CausalSpatial:面向以对象为中心的因果空间推理的基准测试

计算机视觉与模式识别 2026-01-21 v1

摘要

人类可以观察静态场景并瞬间预测接下来会发生什么——移动物体会导致碰撞吗?我们将这种能力称为因果空间推理。然而,当前的多模态大语言模型(MLLMs)无法做到这一点,因为它们在很大程度上仍局限于静态空间感知,难以回答 3D 场景中的“如果……会怎样”问题。我们引入了 CausalSpatial,这是一个诊断基准,用于评估模型是否能够跨四个任务(碰撞、兼容性、遮挡和轨迹)预测物体运动的后果。结果暴露了严重的差距:人类得分 84%,而 GPT-5 仅获得 54%。为什么 MLLMs 会失败?我们的分析揭示了一个根本性缺陷:模型过度依赖偏离视觉证据的文本思维链推理,产生流畅但缺乏空间基础的幻觉。为了解决这个问题,我们提出了因果对象世界模型(COW),该框架通过生成假设动态的视频来外化模拟过程。借助因果关系的显式视觉线索,COW 使模型能够将其推理建立在物理现实而非语言先验之上。我们在此公开了数据集和代码:https://github.com/CausalSpatial/CausalSpatial

关键词

引用

@article{arxiv.2601.13304,
  title  = {CausalSpatial: A Benchmark for Object-Centric Causal Spatial Reasoning},
  author = {Wenxin Ma and Chenlong Wang and Ruisheng Yuan and Hao Chen and Nanru Dai and S. Kevin Zhou and Yijun Yang and Alan Yuille and Jieneng Chen},
  journal= {arXiv preprint arXiv:2601.13304},
  year   = {2026}
}

备注

Code is available: https://github.com/CausalSpatial/CausalSpatial