GRLO:从零开始在开放式环境中实现可泛化强化学习
机器学习
2026-05-18 v1 人工智能
计算与语言
摘要
后训练已成为解锁大型语言模型能力关键步骤,强化学习(RL)正成为关键范式。近期基于RL的后训练日益分为两大范式:一种是基于人类反馈的强化学习(RLHF),通过人类偏好信号在目标领域优化模型;另一种是基于可验证奖励的强化学习(RLVR),在验证器支持的环境中运行。后者因在领域特定任务(如推理)上实现更大提升和更高效率而主导近期推理导向的后训练。然而,尽管领域内RL训练取得了令人期待的性能,但仍需大量GPU计算,这仍是广泛采用的主要障碍。本文研究从小规模交互开始在开放式环境中学习的RLHF泛化能力,探讨其对数学推理和代码生成等下游任务是否能通过对话能力的显性获得而隐式转移,即GRLO。具体而言,在Qwen3-4B-Base主干模型上,GRLO仅通过5K个提示和22.7个GPU小时,使所有领域的平均性能从24.1提升至63.1,数据使用约为强领域内RLVR基线的46倍少,计算量约为68倍少。生成的模型甚至能够与Qwen发布的后训练模型保持竞争力,这些模型所需的训练成本远大于训练成本。值得注意的是,随后的领域内RLVR阶段仅带来有限提升,主要集中在更具挑战性的竞赛数学基准测试上。我们希望GRLO为构建广泛能力的后训练模型提供简单且高效的配方。我们的代码和数据将发布于:\href{https://github.com/SJY8460/GRLO}{https://github.com/SJY8460/GRLO}。
引用
@article{arxiv.2605.15464,
title = {GRLO: Towards Generalizable Reinforcement Learning in Open-Ended Environments from Zero},
author = {Shangjian Yin and Yu Fu and Yue Dong and Zhouxing Shi},
journal= {arXiv preprint arXiv:2605.15464},
year = {2026}
}