中文

仅在有益时行动:通过选择性 Rollout 实现 LLM 推理的高效强化学习

人工智能 2025-06-04 v1 机器学习

摘要

强化学习(如 PPO 和 GRPO)推动了近期 LLM 推理的突破。通过扩展 rollout 以采样更多 prompt,使模型能够选择性地使用更高质量的数据进行训练,从而稳定 RL 训练并提升模型性能。然而,这会带来显著的计算开销。在本文中,我们表明通过在 rollout 前跳过无信息量的 prompt,可以避免很大一部分此类开销。我们对奖励动态的分析揭示了 prompt 价值具有强烈的时间一致性:在一个训练 epoch 中无信息量的 prompt,在未来的 epoch 中很可能仍然无信息量。基于这些洞察,我们提出了 GRESO(GRPO with Efficient Selective Rollout),这是一种在线的轻量级预 rollout 过滤算法,利用奖励训练动态来预测并跳过无信息量的 prompt。通过在广泛的数学推理基准和模型(如 Qwen2.5-Math-1.5B、DeepSeek-R1-Distill-Qwen-1.5B 和 Qwen2.5-Math-7B)上评估 GRESO,我们表明 GRESO 在 rollout 上实现了高达 2.4 倍的挂钟时间加速,在总训练时间上实现了高达 2.0 倍的加速,且没有精度下降。

关键词

引用

@article{arxiv.2506.02177,
  title  = {Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts},
  author = {Haizhong Zheng and Yang Zhou and Brian R. Bartoldson and Bhavya Kailkhura and Fan Lai and Jiawei Zhao and Beidi Chen},
  journal= {arXiv preprint arXiv:2506.02177},
  year   = {2025}
}