中文

攀登无限梯阶:面向视觉语言模型的空间变形推理基准测试

计算机视觉与模式识别 2025-07-08 v1

摘要

人类天然具备形成和操作空间中物体图像与结构的空间推理能力。目前正在努力赋予视觉语言模型(VLM)类似的空间推理能力。然而,目前尚不清楚这些模型是否真正理解和操作空间中的物体。为此,我们提出了新的评估框架,旨在评估VLM在空间变形推理任务中的性能。具体而言,我们构建了一个从2D到3D的空间变形推理基准测试。凭借我们的数据引擎,可以生成无限数量的评估问题对,涉及无限步骤,且不存在数据泄露。我们探讨了模型是否能够有效地从两个方向进行空间变形推理:前向推理(给定操作,找到最终状态)和逆向推理(给定最终状态,确定操作)。我们采用梯子竞赛格式,使用变形步骤数作为等级分类标准,旨在探索模型变形推理能力的边界。有趣的是,基准测试结果表明,几乎没有模型展示出合理的空间变形推理能力。此外,即使应用针对性训练和主流推理增强方法,模型在3D空间变形推理方面仍表现不佳。

关键词

引用

@article{arxiv.2507.02978,
  title  = {Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models},
  author = {Jiahuan Zhang and Shunwen Bai and Tianheng Wang and Kaiwen Guo and Kai Han and Guozheng Rao and Kaicheng Yu},
  journal= {arXiv preprint arXiv:2507.02978},
  year   = {2025}
}