用于LLM推理的稳定策略梯度
机器学习
2026-03-03 v2 人工智能
摘要
强化学习,特别是通过策略梯度方法,在使大型语言模型(LLM)具备推理能力方面发挥着核心作用。然而,策略梯度在此背景下的优化稳定性仍未得到充分研究。因此,现有实现往往会采用保守的超参数选择以确保稳定性,这需要更多的训练样本并增加计算成本。因此,开发可可靠跟踪底层优化动力学并将其用于训练的模型,以实现更高效的样本效率并进一步释放可扩展的后训练潜力具有重要意义。我们通过正式化考虑二阶几何的策略梯度随机优化问题来弥补这一差距。我们提出了一种可计算的框架,用于在策略更新期间跟踪和利用曲率信息。我们进一步利用该框架设计优化过程中的干预措施。所得算法称为曲率感知策略优化(CAPO),它识别贡献不稳定更新的样本并屏蔽它们。理论上,我们在现实假设下建立了单调改进保证。在标准数学推理基准测试上,我们实证表明CAPO在基线严重失败的激进学习 regime 下仍能实现稳定更新。通过最小干预(仅拒绝少于8%的标记),CAPO在LLM推理中相对于标准GRPO实现了最高30倍的样本效率提升。
引用
@article{arxiv.2510.00819,
title = {Stabilizing Policy Gradients for Sample-Efficient Reinforcement Learning in LLM Reasoning},
author = {Luckeciano C. Melo and Alessandro Abate and Yarin Gal},
journal= {arXiv preprint arXiv:2510.00819},
year = {2026}
}
备注
Published at ICLR 2026