中文

CPGD:面向语言模型的稳定规则基强化学习

机器学习 2025-05-20 v1 人工智能

摘要

近期规则基强化学习(RL)的进展显著提升了语言模型(LMs)的推理能力,但现有RL方法(如GRPO、REINFORCE++和RLOO)常因大幅策略更新和不当裁剪导致训练不稳定,甚至引发训练崩溃。为此,本文提出Clipped Policy Gradient Optimization with Policy Drift(CPGD),一种旨在稳定LMs策略学习的新型算法。CPGD基于KL散度引入策略漂移约束,以动态正则化策略更新;并对比值日志比进行裁剪机制,以防止过度策略更新。我们对CPGD提供了理论依据,并通过实证分析表明其缓解了先前方法所观察到的不稳定性。进一步地,我们展示了CPGD在保持训练稳定性的同时显著提升性能。我们的实现在理论严谨性与实际可用性之间取得了平衡,为LMs的后训练RL提供了一种稳健的替代方案。我们已在 https://github.com/ModalMinds/MM-EUREKA 上发布代码。

关键词

引用

@article{arxiv.2505.12504,
  title  = {CPGD: Toward Stable Rule-based Reinforcement Learning for Language Models},
  author = {Zongkai Liu and Fanqing Meng and Lingxiao Du and Zhixiang Zhou and Chao Yu and Wenqi Shao and Qiaosheng Zhang},
  journal= {arXiv preprint arXiv:2505.12504},
  year   = {2025}
}