为何推理在规划中失败:基于规划的长程决策分析
人工智能
2026-02-02 v1 计算与语言
机器学习
摘要
大型语言模型(LLM)驱动的智能体在短程推理方面表现出强大的逐步推理能力,但在长程规划中往往难以维持连贯的行为。我们认为,这一失败反映了根本性的偏差:逐步推理导致形成一种逐步贪心策略,这种策略在短程规划中足够,但在长程规划中失败,因为早期行动必须考虑延迟的后果。从规划导向的角度,我们在确定性、完全结构化的环境中研究 LLM 智能体,这些环境具有明确的状态转换和评估信号。我们的分析揭示了基于推理的策略的核心失败模式:由逐步评分引起的局部最优选择导致早期进行专一决策,这些决策随时间的推移被放大,且难以恢复。我们引入 FLARE(面向未来的前瞻推理搭配奖励估计),作为一种最小化实现,旨在强制进行显式的前瞻、价值传递和有限承诺,使后续结果能够影响早期决策。在多个基准、智能体框架和 LLM 架构中,FLARE 均一致改善了任务性能和规划层面的行为,经常允许 LLaMA-8B 配合 FLARE 超越标准逐步推理的 GPT-4o。这些结果确立了明确的推理与规划之间的区别。
引用
@article{arxiv.2601.22311,
title = {Why Reasoning Fails to Plan: A Planning-Centric Analysis of Long-Horizon Decision Making in LLM Agents},
author = {Zehong Wang and Fang Wu and Hongru Wang and Xiangru Tang and Bolian Li and Zhenfei Yin and Yijun Ma and Yiyang Li and Weixiang Sun and Xiusi Chen and Yanfang Ye},
journal= {arXiv preprint arXiv:2601.22311},
year = {2026}
}