Rollout 分配的最优位置: 基于组的 RLVR 中的 Hit-Utility 最优分配
机器学习
2026-05-11 v1
摘要
可验证奖励的强化学习(RLVR)已成为提高大型语言模型推理能力的核心范式之一。基于组的策略优化方法(如 GRPO)通常为每个提示分配固定数量的 rollout,但这种均匀分配效率低下:它会过度分配给已饱和的提示计算资源,同时对那些额外采样可能暴露有用正确轨迹的提示不足探索。为此,我们引入 hit utility,即在给定的额外分配提议中至少有一个 rollout 正确的后验概率。基于此概念,我们提出 Hit-Utility Optimal Rollout Allocation (HORA),一种在每个分配批次中最大化总体后验 hit utility 的无学习 rollout 分配策略。HORA 在分配过程中自适应地重新分配 rollout 预算,但保持下游奖励评估和基于组的优势估计器不变。在四个数学推理基准和三个模型规模上,HORA 保持与 GRPO 相当的 Pass@1,并在十二个模型--基准配置中提升 Pass@K,其中一个平局和一个饱和例外。它还与诸如 RLOO 等其他基于组的估计器兼容。消融研究表明,HORA 所使用的均匀先验在与五个基于提示条件的学习型先验替代方案方面具有竞争力。
引用
@article{arxiv.2605.07114,
title = {Where to Spend Rollouts: Hit-Utility Optimal Rollout Allocation for Group-Based RLVR},
author = {Tao Wang and Shuo Li and Yan Sun and Dongsheng Ding and Edgar Dobriban},
journal= {arXiv preprint arXiv:2605.07114},
year = {2026}
}