OctoThinker:中期训练激励强化学习规模化
计算与语言
2025-06-26 v1 人工智能
机器学习
摘要
不同的基础语言模型系列,如 Llama 和 Qwen,在采用强化学习( RL )进行后训练时,在推理密集型任务上表现出不同的行为。什么样的基础语言模型适合强化学习?深入了解这一问题对于 developing 下一代可扩展强化学习基础模型至关重要。本文我们研究如何的中期训练策略塑造 RL 动态,关注两个代表性模型系列:Qwen 和 Llama。我们的研究表明:(1) 高质量的数学语料库,如 MegaMath-Web-Pro,显著提高基础模型和 RL 性能,而现有替代方案(如 FineMath-4plus)未能做到这一点;(2) 进一步添加 QA 风格数据,特别是长链式思维( CoT )推理示例,增强了 RL 结果,指令数据进一步释放了这一效果;(3) 虽然长 CoT 改善了推理深度,但也会导致模型响应冗长和 RL 训练不稳定,凸显了数据格式化的重要性;(4) 规模化中期训练持续导致更强的下游 RL 性能。基于这些见解,我们引入一种两种阶段的中期训练策略,Stable-then-Decay,其中基础模型首先在常数学习率下训练 2000 亿标记,然后在三个以 CoT 为焦点的分支上训练 200 亿标记,学习率衰减。这产生了 OctoThinker 系列模型,展示出强大的 RL 兼容性,缩小了与更多 RL 友好模型系列(即 Qwen)之间的性能差距。我们希望本工作将帮助塑造 RL 时代下基础模型的预训练策略。为支持进一步的研究,我们发布我们的开源模型以及一个包含超过 700 亿标记(即 MegaMath-Web-Pro-Max)的精选数学推理密集语料库。
引用
@article{arxiv.2506.20512,
title = {OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling},
author = {Zengzhi Wang and Fan Zhou and Xuefeng Li and Pengfei Liu},
journal= {arXiv preprint arXiv:2506.20512},
year = {2025}
}
备注
26 pages; The first three authors contribute to this work equally