Open-Reasoner-Zero:在基座模型上扩展强化学习的开源方法
机器学习
2025-07-08 v2 计算与语言
摘要
我们介绍了 Open-Reasoner-Zero,这是首个专注于可扩展性、简洁性和可及性的、在基座模型上进行大规模面向推理的强化学习训练的开源实现。通过大量实验,我们证明了一种极简方法——使用带有 GAE(, )的原始 PPO 和直接的基于规则的奖励,而没有任何 KL 正则化——足以扩展基准性能和响应长度,复现了在 DeepSeek-R1-Zero 中观察到的扩展现象。使用与 DeepSeek-R1-Zero-Qwen-32B 相同的基座模型 Qwen2.5-32B base,我们的实现在 AIME2024、MATH500 和 GPQA Diamond 上取得了更优的性能,同时展现出卓越的效率,所需的训练步数仅为 DeepSeek-R1-Zero 流程的 1/10。此外,我们的分析不仅涵盖了训练动态和关键设计选择的消融,还定量展示了 Reasoner-Zero 训练中学习到的评论家如何有效识别并贬低重复的响应模式,从而产生更稳健的优势估计并增强训练稳定性。秉承开源原则,我们发布了源代码、训练数据和各种模型权重,以促进可复现性并鼓励对相关模型特性的进一步探索。
引用
@article{arxiv.2503.24290,
title = {Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model},
author = {Jingcheng Hu and Yinmin Zhang and Qi Han and Daxin Jiang and Xiangyu Zhang and Heung-Yeung Shum},
journal= {arXiv preprint arXiv:2503.24290},
year = {2025}
}