中文

并非所有 rollout 都有用:LLM 强化学习中的下采样 rollout

机器学习 2026-04-23 v5 人工智能 计算与语言

摘要

使用可验证奖励的强化学习 (RLVR) 已成为增强大语言模型推理能力的主要方法。然而,它面临一种根本的计算和内存不对称:rollout 生成高度并行且内存轻,而策略更新则通信密集且内存占用大。为此,我们引入 PODS (Policy Optimization with Down-Sampling),通过仅在策略性选取的 rollout 子集上进行训练来实现 rollout 生成与策略更新的解耦,在保持学习质量的同时显著降低更新成本。我们提出了一种原则性的子集选择准则——最大方差下采样 (max-variance down-sampling),该方法最大化奖励多样性,并提供了高效的 O(nlogn)O(n\log n) 实现。实验表明,PODS 实现的 Group Relative Policy Optimization (GRPO) 在不同推理基准和硬件配置下,相较于原始 GRPO 可至少快 1.7×1.7\times 获得峰值测试准确率。

关键词

引用

@article{arxiv.2504.13818,
  title  = {Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning},
  author = {Yixuan Even Xu and Yash Savani and Fei Fang and J. Zico Kolter},
  journal= {arXiv preprint arXiv:2504.13818},
  year   = {2026}
}

备注

19 pages, 10 figures, TMLR 2026