中文

F-GRPO:别让你的策略学会显而易见的东西,忘记了稀有情况

机器学习 2026-05-26 v2 人工智能

摘要

基于可验证奖励的强化学习(RLVR)通常依赖群抽样来估计优势并稳定策略更新。实际中,计算限制常常导致无法使用非常大的群,从而只能使用有限的 rollout 集合来强化仅其暴露的正确行为。在实际的群大小下,更新可能漏掉稀有的正确轨迹,同时仍包含混合奖励,使概率集中于更常见的采样解。我们推导了此类 prompt-local 尾部遗漏事件的概率作为群大小的函数,揭示非单调行为;在范畴抽象中刻画了未采样正确质量如何即使在总正确质量增长时仍可能缩减。鼓励此分析,我们提出一种难度感知比例系数,灵感来自 Focal loss,对高成功率采样群的更新进行减权。实验方面,范畴仿真说明了相同效应,Maze 提供单解测试,LLM 实验包括代表性的 GRPO 群大小扫描以及在 GRPO、DAPO 和 CISPO 之间的固定 N 迁移。在 Qwen2.5-7B 参数下,N=8 时,我们的方法将平均 math pass@256 从 64.1 提升至 70.3(GRPO),69.3 提升至 72.5(DAPO),73.2 提升至 76.8(CISPO);OOD pass@256 在所有三种情况下均有提升,且未增加群大小或计算成本。

关键词

引用

@article{arxiv.2602.06717,
  title  = {F-GRPO: Don't Let Your Policy Learn the Obvious and Forget the Rare},
  author = {Daniil Plyusov and Alexey Gorbatovski and Boris Shaposhnikov and Viacheslav Sinii and Alexey Malakhov and Daria Korotyshova and Daniil Gavrilov},
  journal= {arXiv preprint arXiv:2602.06717},
  year   = {2026}
}