中文

MazeEval:测试语言模型中序列决策能力的基准

人工智能 2025-07-29 v1

摘要

随着大型语言模型(LLM)越来越多地驱动机器人和具身AI中的自主智能体,理解其空间推理能力对于确保可靠的现实世界部署至关重要。尽管在语言理解方面取得了进展,但当前研究缺乏对LLM在没有视觉线索的情况下如何执行空间导航的评估,而这是具有有限感官信息的智能体运行的基本要求。本文通过引入MazeEval来填补这一空白,该基准旨在通过基于坐标的迷宫导航任务来隔离和评估LLM中的纯空间推理。我们的方法采用函数调用接口,模型仅使用坐标反馈和到墙壁的距离信息(排除视觉输入以测试基本空间认知)来导航不同复杂度(5×55\times 515×1515\times 15网格)的迷宫。我们在相同的迷宫中评估了八种最先进的LLM,分别使用英语和冰岛语,以评估空间能力的跨语言迁移。我们的发现揭示了显著的差异:虽然OpenAI的O3在高达30×3030\times 30大小的迷宫中实现了完美导航,但其他模型在超过9×99\times 9的迷宫中表现出灾难性失败,100%的失败归因于过度的循环行为(模型重复访问一个单元格至少10次)。我们记录了在冰岛语中性能显著下降,模型解决的迷宫比英语中小3-4个尺寸,这表明LLM中的空间推理源于语言模式,而非与语言无关的机制。这些结果对LLM驱动的自主系统的全球部署具有重要意义,表明空间智能从根本上仍受训练数据可用性的限制,并强调了需要架构创新以实现跨语言上下文的可靠导航。

关键词

引用

@article{arxiv.2507.20395,
  title  = {MazeEval: A Benchmark for Testing Sequential Decision-Making in Language Models},
  author = {Hafsteinn Einarsson},
  journal= {arXiv preprint arXiv:2507.20395},
  year   = {2025}
}