LLM是否构建空间世界模型?基于网格世界迷宫任务的证据
人工智能
2026-04-14 v1
摘要
基础模型在各类任务中展现出惊人的性能,但其在构建用于推理和规划的内部空间世界模型的能力尚不明了。我们通过迷宫任务系统性地评估了大型语言模型的空间理解能力,这是一种需要多步骤规划和空间抽象的受控测试环境。通过针对Gemini-2.5-Flash、GPT-5-mini、Claude-Haiku-4.5和DeepSeek-Chat等模型进行全面实验,我们发现其在空间推理方面存在显著差异,这挑战了关于LLM规划能力的假设。在链式思考提示下,Gemini在较小迷宫(5x5至7x7网格)上使用标记化邻接表示时达到80-86%的准确率,但在视觉网格格式下准确率骤降至16-34%,表明这是一种表示依赖性而非格式无关的空间推理。在我们进一步通过顺序近距离问题和组成距离比较进行空间理解探测时,尽管模型在推理痕迹中实现了96-99%的语义覆盖,但未能利用这种理解进行一致的空间计算,表明它们并非构建稳健的空间世界模型,而是在狭窄条件下表现出表示特定且依赖提示的推理。基于迷宫解决任务的我们的发现表明,LLM并不发展出稳健的空间世界模型,而是表现出表示特定和依赖提示的推理,仅在狭窄条件下才得以实现。这一结果对在需要空间抽象的应用中部署基础模型具有重要意义。
引用
@article{arxiv.2604.10690,
title = {Do LLMs Build Spatial World Models? Evidence from Grid-World Maze Tasks},
author = {Weijiang Li and Yilin Zhu and Rajarshi Das and Parijat Dube},
journal= {arXiv preprint arXiv:2604.10690},
year = {2026}
}