ORIGAMISPACE:基于折纸任务评估多模态 LLM 多步骤空间推理能力
人工智能
2025-11-25 v1
摘要
空间推理是人工智能领域的关键能力,尤其在机器人、计算机视觉和自然语言理解等领域至关重要。然而,评估多模态大语言模型(MLLMs)在复杂空间推理中的能力仍面临挑战,尤其是涉及多步骤推理和精确数学约束的场景。本文引入 ORIGAMISPACE,一个新构建的数据集和基准测试,旨在通过折纸任务评估 MLLMs 的多步骤空间推理能力及处理数学约束的能力。该数据集包含 350 个数据实例,每个实例包括严格格式的折痕图(CP diagram)、编译平面图、完整的折叠过程以及最终折叠结果图像。我们提出四个评估任务:图案预测、多步骤空间推理、空间关系预测和端到端 CP 代码生成。对于 CP 代码生成任务,我们设计了交互式环境并探索了使用强化学习训练 MLLMs 的可能性。通过在现有 MLLMs 上进行实验,初步揭示了这些模型在处理复杂空间推理任务时的优势与不足。
引用
@article{arxiv.2511.18450,
title = {ORIGAMISPACE: Benchmarking Multimodal LLMs in Multi-Step Spatial Reasoning with Mathematical Constraints},
author = {Rui Xu and Dakuan Lu and Zicheng Zhao and Xiaoyu Tan and Xintao Wang and Siyu Yuan and Jiangjie Chen and Yinghui Xu},
journal= {arXiv preprint arXiv:2511.18450},
year = {2025}
}