中文

群相对REINFORCE实为离策略算法:解构GRPO及其关联方法的若干谬误

机器学习 2026-03-03 v2 人工智能 计算与语言

摘要

离策略强化学习(RL)对于大型语言模型(LLM)正引发日益关注的兴趣,这源于实际应用中的实际约束、LLM-RL基础设施的复杂性,以及需要进一步创新RL方法论的需求。虽然经典REINFORCE及其现代变体如Group Relative Policy Optimization(GRPO)通常被视为以特定训练数据分布为前提的 on-policy算法,本文首次从原理出发推导群相对REINFORCE——一种使用组内平均奖励作为优势计算基准的REINFORCE变体——揭示其天然的离策略解释。这种视角提出了两个通用原则,以适配REINFORCE于真正的离策略场景:正则化策略更新,主动塑造数据分布。我们的分析解构了关于重要抽样与GRPO中裁剪作用的若干谬误,将两个近期算法——Online Policy Mirror Descent 与 Asymmetric REINFORCE——统一并重新解释为REINFORCE损失的正则化形式,并为看似经验性的数据加权策略提供了理论依据。我们的发现基于大量实证研究,提供了可操作的见解,为LLM离策略RL的原则性算法设计开辟了新机遇。本工作的代码可在 https://github.com/agentscope-ai/Trinity-RFT/tree/main/examples/rec_gsm8k 获得。

关键词

引用

@article{arxiv.2509.24203,
  title  = {Group-Relative REINFORCE Is Secretly an Off-Policy Algorithm: Demystifying Some Myths About GRPO and Its Friends},
  author = {Chaorui Yao and Yanxi Chen and Yuchang Sun and Yushuo Chen and Wenhao Zhang and Xuchen Pan and Yaliang Li and Bolin Ding},
  journal= {arXiv preprint arXiv:2509.24203},
  year   = {2026}
}

备注

Accepted to ICLR 2026. arXiv v2 update: add references and experiments