强化学习用于语言模型规划的益处与陷阱:理论视角
人工智能
2026-03-04 v2 计算与语言
机器学习
机器学习
摘要
近期的强化学习 (RL) 方法显著提升了大语言模型 (LLM) 的规划能力,但其有效性的理论基础仍不明确。在本工作中,我们通过一个易于处理的基于图的抽象来研究 RL 的益处与局限性,重点关注策略梯度 (PG) 和 Q-learning 方法。我们的理论分析表明,监督微调 (SFT) 可能引入基于共现的伪解,而 RL 主要通过探索实现正确规划,凸显了探索在实现更好泛化中的作用。然而,我们也表明 PG 会遭遇多样性塌缩,即输出多样性在训练过程中下降,且即使在达到完美准确率后依然持续。相比之下,Q-learning 提供了两个关键优势:离策略学习和在收敛时保持多样性。我们进一步证明,需要精心设计奖励以防止 Q-learning 中的 Q 值偏差。最后,我们将该框架应用于真实世界规划基准 Blocksworld,确认这些行为在实践中确实存在。
引用
@article{arxiv.2509.22613,
title = {Benefits and Pitfalls of Reinforcement Learning for Language Model Planning: A Theoretical Perspective},
author = {Siwei Wang and Yifei Shen and Haoran Sun and Shi Feng and Shang-Hua Teng and Li Dong and Yaru Hao and Wei Chen},
journal= {arXiv preprint arXiv:2509.22613},
year = {2026}
}