中文

在群体基础RL后训练中合理分配 rollout

机器学习 2026-05-27 v1 人工智能

摘要

强化学习(RL)是后训练大型语言模型的主导范式。然而,在在线、基于策略的场景中,rollout生成占据训练成本的主导地位。群体基础策略优化方法会对每个提示生成多个rollout以计算优势,但这些方法会在提示的奖励分布塌陷时不成比例地分配预算,将昂贵的rollout浪费在微不足道的学习信号上。我们展示,群体基础更新在奖励方差高的条件下最为有效。由于策略在训练期间不断演化,提示的可信度必须在线估计,而非预先计算,但穷举评估每个提示在计算上是不可行的。我们引入Pilot-Commit—a一种面向群体基础RL后训练的预算感知rollout分配框架。Pilot-Commit将提示评估与开发分离:先行阶段使用预算的一部分来估计每个提示的可信度,其余rollout被分配给高杠杆提示,而低信号提示则被跳过。跨越多个数学推理基准和从15亿到140亿参数的模型尺度,Pilot-Commit在显著降低采样成本的同时匹配基线准确率,以累计rollout计,达到GRPO的1.9倍速度,DAPO的4.0倍速度。

关键词

引用

@article{arxiv.2605.26606,
  title  = {Spend Your Rollouts Where It Counts: Rollout Allocation for Group-Based RL Post-Training},
  author = {Woojeong Kim and Ziyi Yang and Jing Nathan Yan and Jialu Liu},
  journal= {arXiv preprint arXiv:2605.26606},
  year   = {2026}
}