拼图:从感知到理解再到视觉语言模型中的推理
人工智能
2025-08-27 v4
摘要
空间推理是人类认知的核心组成部分,使个体能够感知、理解并与物理世界交互。它依赖于对空间结构和对象间关系的细致理解,为复杂的推理和决策提供了基础。为考察当前视觉语言模型(VLM)是否具备类似能力,我们引入Jigsaw-Puzzles,这是一个包含1100个精心挑选的具有高空间复杂性的真实世界图像的新型基准测试数据集。基于该数据集,我们设计了五个任务,严格评估VLM的空间感知、结构理解和推理能力,同时刻意减少对领域特定知识的依赖,以更好地隔离和评估通用空间推理能力。我们对24个最先进的VLM进行了全面评估。结果表明,即便是最强的模型Gemini-2.5-Pro也仅实现77.14%的总体准确率,在Order Generation任务上表现尤其差,准确率仅为30.00%,远低于人类参与者超过90%的表现。这一持续的差距凸显了需要持续进步的必要,将Jigsaw-Puzzles定位为推进VLM空间推理研究的具有挑战性和诊断性的基准测试。我们的项目页面位于https://zesen01.github.io/jigsaw-puzzles。
引用
@article{arxiv.2505.20728,
title = {Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models},
author = {Zesen Lyu and Dandan Zhang and Wei Ye and Fangdi Li and Zhihang Jiang and Yao Yang},
journal= {arXiv preprint arXiv:2505.20728},
year = {2025}
}
备注
Accepted by EMNLP 2025 Main conference