并非所有 rollout 都有用:LLM 强化学习中的下采样 rollout
机器学习
2026-04-23 v5 人工智能
计算与语言
摘要
使用可验证奖励的强化学习 (RLVR) 已成为增强大语言模型推理能力的主要方法。然而,它面临一种根本的计算和内存不对称:rollout 生成高度并行且内存轻,而策略更新则通信密集且内存占用大。为此,我们引入 PODS (Policy Optimization with Down-Sampling),通过仅在策略性选取的 rollout 子集上进行训练来实现 rollout 生成与策略更新的解耦,在保持学习质量的同时显著降低更新成本。我们提出了一种原则性的子集选择准则——最大方差下采样 (max-variance down-sampling),该方法最大化奖励多样性,并提供了高效的 实现。实验表明,PODS 实现的 Group Relative Policy Optimization (GRPO) 在不同推理基准和硬件配置下,相较于原始 GRPO 可至少快 获得峰值测试准确率。
关键词
引用
@article{arxiv.2504.13818,
title = {Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning},
author = {Yixuan Even Xu and Yash Savani and Fei Fang and J. Zico Kolter},
journal= {arXiv preprint arXiv:2504.13818},
year = {2026}
}
备注
19 pages, 10 figures, TMLR 2026