中文

XRPO:通过有针对性的探索与开发推动 GRPO 的极限

机器学习 2026-05-26 v3

摘要

强化学习算法如 GRPO 已推动大语言模型(LLM)推理方面的近期进展。尽管扩大 rollout 数量可稳定训练,但现有方法在挑战性提示上存在有限的探索,以及对信息丰富的反馈信号未得到充分利用,这源于对提示的 rollout 分配在上下文独立 manner(例如每条提示生成 16 个 rollout)以及依赖稀疏奖励。本文提出 XRPO(eXplore - eXploit GRPO),一个统一框架,通过原则性地将策略优化重构为 rollout 探索-开发。为增强探索,XRPO 引入一个在数学上有依据的 rollout 分配器,适应性地优先考虑具有更大不确定性减少潜力的提示。它进一步通过 in-context seeding 策略注入精选示例,以应对零奖励提示的停滞,引导模型进入更具挑战性的推理轨迹。为加强开发,XRPO 发展了一种基于组相对 novelty-aware advantage sharpening 机制,利用序列概率放大低概率但正确的响应,从而将策略的覆盖范围扩展到稀疏奖励之外。在 diverse math 和 coding 基准测试中,对 reasoning 和 non-reasoning 模型进行实验,表明 XRPO 在通过率(pass@1)提升最高可达 4%,在 cons@32 中提升最高可达 6%,同时将训练收敛速度提高最高可达 2.7 倍。

关键词

引用

@article{arxiv.2510.06672,
  title  = {XRPO: Pushing the limits of GRPO with Targeted Exploration and Exploitation},
  author = {Udbhav Bamba and Minghao Fang and Yifan Yu and Haizhong Zheng and Fan Lai},
  journal= {arXiv preprint arXiv:2510.06672},
  year   = {2026}
}