大语言模型是否从文本中构建世界模型?空间推理的多语言诊断
人工智能
2026-05-28 v1
摘要
大语言模型(LLMs)是否能够从纯文本描述中构建内部空间世界模型仍有争议,且是否存在跨语言迁移能力尚未系统研究。我们引入了 MentalMap,一个包含六个等级能力层级(L0-L5)的多语言诊断基准,涵盖从原子空间事实到生成式世界图构建,以及四个诊断轴:参考系、阅读方向偏置、推理-effort 分配和幻觉。MentalMap 基于 100 个 ProcTHOR 家庭场景,覆盖八种类型多样的语言,外加结构化文本控制,包含 39 个任务家族,1950 个评估单元。评估了十三种大语言模型在不同规模和模型家族中的表现,我们发现存在普遍的 L3 推理悬崖:一旦基线原子准确率超过 40%,任何模型在视点推理中都无法保留甚至一半的 L0 性能。尽管如此,结构化输出失败和推理模式在不同模型间差异很大。相同的纯文本协议下的人类评估也复现了相同的失败模式,这表明瓶颈源于文本唯一的工作记忆限制,而非当前 LLM 架构本身。我们的发现重新定义了纯文本空间推理是一个多轴世界建模问题,并激励了多模态和 scratchpad 增强推理作为未来方向。
引用
@article{arxiv.2605.28277,
title = {Do LLMs Build World Models From Text? A Multilingual Diagnostic of Spatial Reasoning},
author = {Zhikai Pan and Chih-Ting Liao and Chunrui Liu and Xi Xiao and Yitong Qiao and Chunlei Meng and Zhangquan Chen and Xin Cao},
journal= {arXiv preprint arXiv:2605.28277},
year = {2026}
}