通过二阶 rollout 实现更好的 RL 训练数据利用
计算与语言
2026-02-27 v1
摘要
强化学习(RL)已为大型语言模型(LLM)赋予了强大的推理能力,但纯粹的 RL 主要通过仅使用一阶 rollout(为问题生成多个响应)来关注生成能力的提升,我们认为这种方法未能充分利用训练数据的潜力,因为忽略了批判能力的训练。为解决这一问题,我们进一步引入二阶 rollout(为响应生成多个批判)的概念,并提出一个统一的框架,用于联合训练生成和批判能力。广泛的实验在各种模型和数据集上表明,我们的方法在相同训练数据下比纯粹的 RL 更有效地利用训练数据并取得更好性能。此外,我们发现了关于二阶 rollout 和批判训练的若干启发性发现,如批判训练中标签平衡的重要性以及基于结果奖励的噪声问题,这些可以通过抽样技术来缓解。我们的工作为 RL 中的动态数据增强和联合生成-批判训练提供了初步的探索,为进一步发展 RL 训练提供了有意义的启示。
关键词
引用
@article{arxiv.2602.22765,
title = {Towards Better RL Training Data Utilization via Second-Order Rollout},
author = {Zhe Yang and Yudong Wang and Rang Li and Zhifang Sui},
journal= {arXiv preprint arXiv:2602.22765},
year = {2026}
}