中文

GRPO 有多远的 off-policy?Mu-GRPO 实现高效 LLM 强化学习

机器学习 2026-05-19 v1 计算与语言

摘要

Group Relative Policy Optimization (GRPO) 已是近期在大型语言模型上基于可验证奖励的强化学习(RLVR)的关键推动力,但通常在低时延、接近 on-policy 的 regime 下进行,造成显著系统开销。我们提出一个简单问题:GRPO 能多远地走向 off-policy?我们表明 GRPO 类算法可容忍显著更大的 rollout 时延,提出 Mu-GRPO,这是一种 RL 训练框架,将训练组织为少数几个(例如四个)大规模顺序生成-优化阶段。此设计导致高 rollout 时延,同时大幅减少 rollout-优化切换开销。为稳定使用过期数据进行学习,Mu-GRPO 结合松化裁剪(保留有用过期 rollout 梯度)和负优势否决(消除负优势响应中后置后缀更新的干扰)。在五个语言模型和多个数学推理基准上,Mu-GRPO 在匹配或超越标准 GRPO 的同时,实现了约 2 倍的墙钟训练时间加速,显著改善了 LLM 强化学习的性能-效率权衡。

关键词

引用

@article{arxiv.2605.17570,
  title  = {How Off-Policy Can GRPO Be? Mu-GRPO for Efficient LLM Reinforcement Learning},
  author = {Minghao Tian and Yunfei Xie and Chen Wei},
  journal= {arXiv preprint arXiv:2605.17570},
  year   = {2026}
}