大型语言模型在确定性游戏智能体框架中的涌现推理能力限制
人工智能
2025-10-21 v1
摘要
最近的研究报告称,大型推理模型(LRMs)在解决特定难度阈值以上的谜题时会出现性能崩溃。在后续讨论中,人们质疑这种任务的性质是否混淆了对真实推理能力的评估。一个可能的混淆因素是模型需要自行跟踪状态空间。我们为大型语言模型(LLM)提供了一个环境接口,用于塔塔 Hanoi(Tower of Hanoi)问题,使其能够通过工具调用做出移动,提供书面论证,观察结果状态空间,并为下一步移动重新提示。我们观察到,访问环境接口并未延迟或消除性能崩溃。此外,LLM 参数化的策略分析揭示了模型在复杂性每个层面上与最优策略和均匀随机策略之间存在日益增加的偏离,表明该模型在每个复杂性层面上表现出类似模式的崩溃,且性能取决于该模式是否反映了问题的正确解。我们认为,类似的现象可能在 LRM 中也会发生。
引用
@article{arxiv.2510.15974,
title = {Limits of Emergent Reasoning of Large Language Models in Agentic Frameworks for Deterministic Games},
author = {Chris Su and Harrison Li and Matheus Marques and George Flint and Kevin Zhu and Sunishchal Dev},
journal= {arXiv preprint arXiv:2510.15974},
year = {2025}
}