中文

LEGO-Puzzles:多步骤空间推理能力评估

人工智能 2025-06-23 v3

摘要

多步骤空间推理涉及理解和推理跨越多个顺序步骤的空间关系,这对于解决机器人操作、自动导航和自动装配等复杂现实应用至关重要。为评估当前多模态大语言模型 (MLLM) 掌握这一基本能力的程度,我们引入 LEGO-Puzzles,一个可扩展的基准测试,旨在通过 LEGO 任务评估 MLLM 的空间理解和顺序推理能力。LEGO-Puzzles 包含 1,100 个精心策划的视觉问答 (VQA) 样本,涵盖 11 项不同任务,从基本空间理解到复杂多步骤推理。基于 LEGO-Puzzles,我们对 20 项最先进 MLLM 进行全面评估,发现其空间推理能力存在显著局限:即使是最强大的 MLLM 也只能回答约半数测试案例,而人类参与者准确率超过 90%。此外,基于 LEGO-Puzzles,我们设计生成任务以探讨 MLLM 是否能够将其空间理解和推理能力迁移到图像生成。我们的实验显示,仅 GPT-4o 和 Gemini-2.0-Flash 表现出有限的指令遵循能力,而其他 MLLM 要么复制输入图像,要么生成完全无关的输出。总体而言,LEGO-Puzzles 揭示了现有 MLLM 在空间理解和顺序推理方面的关键缺陷,并凸显了需要进一步发展多模态空间推理的必要性。

关键词

引用

@article{arxiv.2503.19990,
  title  = {LEGO-Puzzles: How Good Are MLLMs at Multi-Step Spatial Reasoning?},
  author = {Kexian Tang and Junyao Gao and Yanhong Zeng and Haodong Duan and Yanan Sun and Zhening Xing and Wenran Liu and Kaifeng Lyu and Kai Chen},
  journal= {arXiv preprint arXiv:2503.19990},
  year   = {2025}
}

备注

11 pages, 3 figures