中文

Blueprint-Bench:比较 LLM、智能体与图像模型的空间智能

人工智能 2025-10-01 v1

摘要

我们引入了Blueprint-Bench,这是一个旨在通过将公寓照片转换为精确的2D平面图的任务来评估AI模型空间推理能力的基准测试。虽然输入模态(照片)完全在现代多模态模型的训练分布内,但空间重建任务需要真正的空间智能:推断房间布局、理解连通性以及保持一致的尺度。我们在包含50套公寓、每套约20张室内图像的数据集上,评估了领先的语言模型(GPT-5、Claude 4 Opus、Gemini 2.5 Pro、Grok-4)、图像生成模型(GPT-Image、NanoBanana)以及智能体系统(Codex CLI、Claude Code)。我们的评分算法基于房间连通性图和面积排名来衡量生成的平面图与真实平面图之间的相似度。结果揭示了当前AI能力的一个显著盲区:大多数模型的表现等于或低于随机基线,而人类的表现依然显著优越。图像生成模型在遵循指令方面尤为挣扎,而具备迭代细化能力的基于智能体的方法相比单次生成并未显示出有意义的改进。Blueprint-Bench提供了首个用于比较不同模型架构间空间智能的数值化框架。我们将继续评估新发布的模型并欢迎社区提交,以监测通用AI系统中空间智能的出现。

关键词

引用

@article{arxiv.2509.25229,
  title  = {Blueprint-Bench: Comparing spatial intelligence of LLMs, agents and image models},
  author = {Lukas Petersson and Axel Backlund and Axel Wennstöm and Hanna Petersson and Callum Sharrock and Arash Dabiri},
  journal= {arXiv preprint arXiv:2509.25229},
  year   = {2025}
}

备注

9 pages, 8 figures, submitted for ICLR 2026