SimpleRL-Zoo:探索与控制野外开放基模型的零强化学习
机器学习
2025-08-07 v3 人工智能
计算与语言
摘要
DeepSeek-R1 表明,通过基于规则的奖励函数的简单强化学习(RL)框架,长链式思维(CoT)推理可以自然地从基模型开始训练,形成一种称为零RL训练的范式。最近大量复现零RL训练的工作主要聚焦于 Qwen2.5 模型系列,而我们发现基模型已展现出强大的指令跟随与自我反思能力。本文我们探索了在10个多样化基模型上的零RL训练,包括 LLama3-8B、Mistral-7B/24B、DeepSeek-Math-7B、Qwen2.5-math-7B 以及 0.5B 到 32B 所有 Qwen2.5 模型。通过调整格式奖励和控制查询难度等关键设计策略,在大多数设置下实现了推理准确率和响应长度的显著提升。然而,通过仔细监控训练动力学,我们发现不同基模型在训练期间呈现出不同的模式。例如,响应长度的增加并不总是与某些认知行为(如验证,即“恍然大悟”时刻)的出现相关联。值得注意的是,我们首次在非 Qwen 系列的小模型中观察到“恍然大悟”现象。我们分享实现成功零RL训练的关键设计,以及我们的发现与实践。为促进进一步的研究,我们开源了代码、模型和分析工具。
引用
@article{arxiv.2503.18892,
title = {SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild},
author = {Weihao Zeng and Yuzhen Huang and Qian Liu and Wei Liu and Keqing He and Zejun Ma and Junxian He},
journal= {arXiv preprint arXiv:2503.18892},
year = {2025}
}
备注
Published as a conference paper at COLM 2025