中文

自适应边界裁剪 GRPO:确保有界比值以实现稳定和可泛化的训练

机器学习 2026-01-08 v1 人工智能 计算与语言

摘要

Group Relative Policy Optimization (GRPO) 已成为大型语言模型 (LLM) 强化学习中流行的算法。然而, upon 分析其裁剪机制后,我们认为其在某些情境下是次优的。通过适当的修改,GRPO 可显著提升以提高灵活性和泛化能力。为此,我们提出了自适应边界裁剪 GRPO (ABC-GRPO),即对原始 GRPO 框架的非对称和自适应改进。我们表明,ABC-GRPO 在使用 Qwen3 LLMs 进行数学推理任务时优于标准 GRPO。此外,ABC-GRPO 在训练过程中保持显著更高的熵,从而保留模型的探索能力并缓解早期收敛。实现代码已在线上提供以便可重复性 https://github.com/chi2liu/ABC-GRPO。

关键词

引用

@article{arxiv.2601.03895,
  title  = {Adaptive-Boundary-Clipping GRPO: Ensuring Bounded Ratios for Stable and Generalizable Training},
  author = {Chi Liu and Xin Chen},
  journal= {arXiv preprint arXiv:2601.03895},
  year   = {2026}
}

备注

10 pages, 4 figures