中文

大规模推理模型高效GRPO训练的预测比例定律

机器学习 2026-03-23 v3

摘要

使用类似于群体相对政策优化(GRPO)的强化学习方法对大型语言模型(LLM)进行推理任务微调计算成本高昂。为此,我们提出了一个预测框架,用于建模训练动力学并帮助优化资源使用。通过对Llama和Qwen模型(3B 8B)的实验,我们推导出一种基于模型规模、初始性能和训练进度的经验比例定律。该定律预测奖励轨迹,并识别出三个一致的训练阶段:慢启动、快速改进和平台期。我们发现,超过 certain 数量的 epoch后训练几乎没有收益,表明可以显著减少计算量而不损失性能。该方法在不同模型类型之间具有普适性,为高效的GRPO-based微调提供了实用指南。

关键词

引用

@article{arxiv.2507.18014,
  title  = {Predictive Scaling Laws for Efficient GRPO Training of Large Reasoning Models},
  author = {Datta Nimmaturi and Vaishnavi Bhargava and Rajat Ghosh and Johnu George and Debojyoti Dutta},
  journal= {arXiv preprint arXiv:2507.18014},
  year   = {2026}
}