自适应边界裁剪 GRPO:确保有界比值以实现稳定和可泛化的训练
机器学习
2026-01-08 v1 人工智能
计算与语言
摘要
Group Relative Policy Optimization (GRPO) 已成为大型语言模型 (LLM) 强化学习中流行的算法。然而, upon 分析其裁剪机制后,我们认为其在某些情境下是次优的。通过适当的修改,GRPO 可显著提升以提高灵活性和泛化能力。为此,我们提出了自适应边界裁剪 GRPO (ABC-GRPO),即对原始 GRPO 框架的非对称和自适应改进。我们表明,ABC-GRPO 在使用 Qwen3 LLMs 进行数学推理任务时优于标准 GRPO。此外,ABC-GRPO 在训练过程中保持显著更高的熵,从而保留模型的探索能力并缓解早期收敛。实现代码已在线上提供以便可重复性 https://github.com/chi2liu/ABC-GRPO。
引用
@article{arxiv.2601.03895,
title = {Adaptive-Boundary-Clipping GRPO: Ensuring Bounded Ratios for Stable and Generalizable Training},
author = {Chi Liu and Xin Chen},
journal= {arXiv preprint arXiv:2601.03895},
year = {2026}
}
备注
10 pages, 4 figures