中文

H"older策略优化

机器学习 2026-05-22 v2 人工智能

摘要

组相对策略优化(GRPO)通过估计一组抽样轨迹之间的优势来增强大型语言模型,但将这些轨迹级优势映射到策略更新上需要在每个序列中聚合token级概率。依赖固定聚合机制在这一步骤上本质上限制了算法的可适应性。经验上,我们观察到一种关键权衡:某些固定聚合常常导致训练崩溃,而另一些则未能获得令人满意的性能。为解决此问题,我们提出了\textbf{H"{o}lderPO},一种通过H"older均值统一token级概率聚合的通用策略优化框架。通过显式调制参数pp,我们的框架提供了关于梯度集中度与方差界之间权衡的连续控制。理论上,我们证明,pp值越大,梯度越集中以放大稀疏学习信号;而pp值越小,梯度方差被严格限制。由于没有静态配置能普遍解决此集中-稳定性权衡,我们以动态退火算法实例化该框架,在训练生命周期中逐步调度pp。广泛的评估表明,我们的方法在现有基线上实现了更好的稳定性和收敛性。具体而言,我们的方法在多个数学基准上实现了最高的平均准确率54.9%,相较于标准GRPO提升了约7.2%的相对增益,并在ALFWorld上实现了卓越的93.8%成功率。

关键词

引用

@article{arxiv.2605.12058,
  title  = {Holder Policy Optimisation},
  author = {Yuxiang Chen and Dingli Liang and Yihang Chen and Ziqin Gong and Chenyang Le and Zhaokai Wang and Jiachen Zhu and Lingyu Yang and Jianghao Lin and Weinan Zhang and Jun Wang},
  journal= {arXiv preprint arXiv:2605.12058},
  year   = {2026}
}