中文

LLM强化学习后训练的缩放行为:基于数学推理的实证研究

机器学习 2026-04-20 v4 人工智能

摘要

尽管大语言模型(LLMs)在预训练阶段的缩放规律已被广泛研究,但其在强化学习(RL)后训练阶段的行为在很大程度上仍未被探索。本文对基于RL的后训练中的缩放行为进行了系统的实证研究,特别聚焦于数学推理。基于在完整的Qwen2.5稠密模型系列(0.5B至72B)上的一组实验,我们刻画了模型规模、数据量和计算预算如何相互作用以塑造性能。我们的分析得出了四项关键发现:1. 在计算和数据指标上,较大的模型始终表现出更优的学习效率。2. 测试损失、计算和数据之间的关系可以用一个预测性幂律来建模,该幂律在基座模型和指令微调模型中均具有稳健性。3. 尽管较大的模型表现出更高的学习效率,但幂律中的解析学习效率项 k(N) 揭示了随着模型规模持续增大,学习效率存在潜在的饱和趋势。4. 在数据受限的情况下,重复使用高质量数据被证明非常有效,因为最终性能主要取决于总优化步数,而非样本的唯一性。总体而言,这些结果为通过RL后训练高效缩放LLM的推理能力提供了原则性基础和实践指导。

关键词

引用

@article{arxiv.2509.25300,
  title  = {Scaling Behaviors of LLM Reinforcement Learning Post-Training: An Empirical Study in Mathematical Reasoning},
  author = {Zelin Tan and Hejia Geng and Xiaohang Yu and Mulei Zhang and Guancheng Wan and Yifan Zhou and Qiang He and Xiangyuan Xue and Heng Zhou and Yutao Fan and Zhongzhi Li and Zaibin Zhang and Guibin Zhang and Chen Zhang and Zhenfei Yin and Philip Torr and Lei Bai},
  journal= {arXiv preprint arXiv:2509.25300},
  year   = {2026}
}

备注

V4 version:This Paper has been accepted by ACL 2026 Main Conference