SokoBench:评估大语言模型中的长期规划与推理
人工智能
2026-01-29 v1
摘要
尽管大语言模型的能力正在被 increasingly 在复杂推理任务上进行测试,但其长期规划能力尚未得到广泛探讨。本 work 提出了对最先进大规模推理模型(LRMs)规划与长期推理能力的系统性评估。我们提出了基于 Sokoban 拼图的新基准,故意简化以隔离长期规划与状态持久性之间的关系。我们的发现表明,当需要超过 25 步才能到达解决方案时,规划性能会持续下降,这表明前向规划能力存在根本性限制。我们表明,为 LRMs 配备规划域定义语言(PDDL)解析、验证和求解工具可带来适度的改进,这表明可能存在某种体系结构限制,这些限制可能无法通过仅靠测试时扩张方法来克服。
引用
@article{arxiv.2601.20856,
title = {SokoBench: Evaluating Long-Horizon Planning and Reasoning in Large Language Models},
author = {Sebastiano Monti and Carlo Nicolini and Gianni Pellegrini and Jacopo Staiano and Bruno Lepri},
journal= {arXiv preprint arXiv:2601.20856},
year = {2026}
}