中文

按生成顺序修剪:加速 RLVR 的在线滚动修剪

计算与语言 2026-03-27 v1

摘要

可验证奖励强化学习 (RLVR) 已显著提升了大型语言模型 (LLM) 的推理能力。然而,诸如 GRPO 和 DAPO 等方法因为每个提示需进行大量抽样而导致计算成本高昂。此外,在 RLVR 中,相对优势往往稀疏:许多样本要么几乎全正确,要么全错误,导致组内奖励方差低,从而学习信号弱。本文引入 arrol (Accelerating RLVR via online Rollout Pruning),一种在生成过程中进行的在线滚动修剪方法,通过显式引导存活下来的滚动更平衡地分布在正确与错误之间,以增强学习信号。具体而言,arrol 在生成时训练一个轻量级质量头部,用于预测部分滚动的成功概率,并据此做出早期修剪决策。学习得到的质量头部还能在测试时对候选答案进行加权,以提高推理准确性。为提升效率,我们提出一种系统设计,将滚动修剪置于推理引擎内部,并对剩余样本重新分批进行对数概率计算和策略更新。在 Qwen-3 和 LLaMA-3.2 模型(1B-8B)上的 GRPO 和 DAPO 实验中,arrol 在平均准确率上提升 +2.30 至 +2.99 个百分点,实现最高可达 1.7 倍的训练加速,并在测试时扩展中实现最高可达 +8.33 个百分点的额外准确率提升。代码已公开于 https://github.com/Hsu1023/ARRoL。

关键词

引用

@article{arxiv.2603.24840,
  title  = {Prune as You Generate: Online Rollout Pruning for Faster and Better RLVR},
  author = {Haobo Xu and Sirui Chen and Ruizhong Qiu and Yuchen Yan and Chen Luo and Monica Cheng and Jingrui He and Hanghang Tong},
  journal= {arXiv preprint arXiv:2603.24840},
  year   = {2026}
}

备注

17 pages, 4 figures