GamiBench:基于折纸任务评估多模态大语言模型的空间推理与二维到三维规划能力
人工智能
2025-12-30 v1
摘要
多模态大语言模型(MLLMs)在感知和指令跟随方面表现优异,但仍在空间推理方面存在挑战,即在多个视角和时间维度上对物体进行心理跟踪和操作。空间推理是人类智能的关键组成部分,但大多数现有基准仅关注静态图像或最终输出,未能考虑到这一技能的序列性和视点依赖性。为弥合这一差距,我们提出了GamiBench——一个通过折纸式折叠任务来评估MLLMs空间推理和二维到三维规划能力的基准测试。GamiBench包含186个常规二维折痕图案和186个不可行的二维折痕图案,配有对应的三维折叠形状,来自六个不同视角,涵盖三个视觉问答(VQA)任务:预测三维折叠配置、区分有效视角、检测不可行图案。与之前仅评估最终预测的基准测试不同,GamiBench从整体上评估整个推理过程——衡量跨视角一致性、通过不可行折叠检测评估物理可行性,并解释中间折叠步骤。进一步引入了新的诊断性指标——视角一致性(VC)和不可行折叠选择率(IFSR)——以衡量模型处理不同复杂度折叠任务的能力。我们的实验表明,即使是GPT-5和Gemini-2.5-Pro等领先模型在单步空间理解方面也表现不佳。这些贡献建立了一个用于评估MLLMs几何理解和空间推理能力的标准化框架。数据集和代码:https://github.com/stvngo/GamiBench。
引用
@article{arxiv.2512.22207,
title = {GamiBench: Evaluating Spatial Reasoning and 2D-to-3D Planning Capabilities of MLLMs with Origami Folding Tasks},
author = {Ryan Spencer and Roey Yaari and Ritvik Vemavarapu and Joyce Yang and Steven Ngo and Utkarsh Sharma},
journal= {arXiv preprint arXiv:2512.22207},
year = {2025}
}