无限抽样:大型语言模型分组强化学习训练的高效稳定方法
机器学习
2025-07-01 v1
摘要
基于分组的强化学习算法,如 Group Reward Policy Optimization (GRPO),已证明对使用人类反馈微调大型语言模型 (LLM) 效果良好。然而,生成和存储每个提示的多个响应会导致巨大的内存开销,尤其当样本组大小增加时,这在受限硬件条件下限制了可扩展性。我们提出了无限抽样框架,通过将组规模与 GPU 内存使用相分离,实现高效稳定的 GRPO 训练。该框架包括:(1) 微型抽样组,将大型组拆分为内存可行的轮次;(2) 持续抽样,通过跨组交错生成提高利用率;以及 (3) 长度感知调度器,将标记条件序列长度预测与两个阶段计划结合:全局分组通过 FPTAS 实现,运行时通过 SJF 实现补充。实验表明,我们的微型抽样组将峰值内存使用降低了 50% 以上(例如,从 Qwen3-1.7B 上的 21.55 GB 降至 10.64 GB)。在此基础上,无限抽样比朴素的微型抽样组方法提高了 25% 以上的吞吐量,同时在保持完整长度完成和内存使用方面,减少了解码步骤。我们的混合调度确保了在现实 GPU 内存限制下的大规模分组的高效稳定 GRPO 训练。
引用
@article{arxiv.2506.22950,
title = {Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models},
author = {Liangyu Wang and Huanyi Xie and Xinhai Wang and Tianjin Huang and Mengdi Li and Di Wang},
journal= {arXiv preprint arXiv:2506.22950},
year = {2025}
}