心智缺口:基于Spatial-Gym的空间推理与行动能力评估
人工智能
2026-04-13 v1 计算与语言
摘要
空间推理是导航和机器人学中的核心能力,但衡量模型在此类任务中的性能仍存在困难。现有基准在单次评估中测试模型,要求模型在单一响应中生成完整解答,与人类在交互式环境中逐步工作不同。我们引入Spatial-Gym,一个Gymnasium环境,通过在2D网格谜题中测试路径规划,将其作为具有可选回溯的序列决策任务进行测试。我们在500个episode中评估了八个模型在三种设置(单次、逐步、带回溯)下的表现,分别与人类、随机和A*基准进行比较。最佳模型GPT-OSS 120B在单次、逐步、带回溯三种设置下的解题率分别为16.0%、82.0%,后者与人类基准(98.0%)相差82.0%。逐步格式对较弱模型有益(提升5.4%),但对较强模型有负面影响(降低5.6%),因为限制了全局规划。回溯提升了episode完成率,但仅对较弱模型的解题率有显著提升;较强模型很少回溯,未受益。我们的实验有三个关键发现:(1)模型未能根据难度调整推理投入,(2)接收空间环境图像的视觉模型解题率下降73%,(3)即使在逐步设置下,扩展的链式思考推理仍比标准推理保持3-5倍的准确率优势。Spatial-Gym为诊断模型局限性并通过强化学习改进空间推理提供了框架。
引用
@article{arxiv.2604.09338,
title = {Mind the Gap Between Spatial Reasoning and Acting! Step-by-Step Evaluation of Agents With Spatial-Gym},
author = {Lars Benedikt Kaesberg and Tianyu Yang and Niklas Bauer and Terry Ruas and Jan Philip Wahle and Bela Gipp},
journal= {arXiv preprint arXiv:2604.09338},
year = {2026}
}