中文

揭示隐式优势对称性:为何 GRPO 在探索与难度适应方面受限

机器学习 2026-03-31 v3 人工智能

摘要

基于可验证奖励的强化学习 (RLVR),特别是 GRPO,已成为激发大语言模型推理能力的标准方法,但其在探索效率和难度适应方面的效率仍是未开放的挑战。本文认为,这些瓶颈源于组相对优势估计 (GRAE) 固有的隐式优势对称性。该对称性导致两个关键限制:(i)在组层面,正确轨迹与错误轨迹间权重严格对称,导致未采样的动作 logits 不变,从而阻碍对新正确解答的探索;(ii)在样本层面,算法隐式优先考虑中等难度样本,对难度聚焦的非平稳需求保持不知情。通过控制实验,我们揭示了这种对称性是次优的,提出两个关键见解:(i)对正确轨迹的优势进行非对称抑制可促进必要的探索;(ii)学习效率最大化依赖于课程式方法,初始优先简单样本,再逐渐转向复杂样本。基于这些发现,我们提出非对称 GRAE (A-GRAE),动态调节探索激励和样本难度聚焦。跨七大基准实验表明,A-GRAE 在 LLMs 和 MLLMs 上均一致优于 GRPO 及其变体。

关键词

引用

@article{arxiv.2602.05548,
  title  = {Unveiling Implicit Advantage Symmetry: Why GRPO Struggles with Exploration and Difficulty Adaptation},
  author = {Zhiqi Yu and Zhangquan Chen and Mengting Liu and Heye Zhang and Liangqiong Qu},
  journal= {arXiv preprint arXiv:2602.05548},
  year   = {2026}
}