Rollout Pass-Rate 控制:引导二元奖励 RL 向其最信息性的区域
机器学习
2026-05-18 v3
摘要
用于软件工程的智能体强化学习 (RL) 在计算资源上花费了大量资源用于其状态轨迹,其分组二元奖励高度偏斜且判别性很弱。我们将其表述为 pass-rate 控制,并展示在四个标准下,二元奖励信号在约 50% rollout pass rate 时最为强烈:奖励熵、group-filtering 活生生、leave-one-out (RLOO) advantage 能量在 Group Relative Policy Optimization (GRPO) 下,以及 success-failure 对数。我们提出了前缀抽样 (Prefix Sampling, PS),通过重放自生成的轨迹前缀来将偏斜的 group 引导至该区域:成功的前缀为大多数失败的 group 提供头启动,而失败的前缀则削弱大多数通过的 group。重放的状态通过现有的 rollout 路径进行重建,重放的 token 从 loss 中被屏蔽,以便仅对当前策略的 continuation 应用优化。在SWE-bench Verified 上,PS 在基线高分区域内到达评估波动范围,同时在 Qwen3-14B 和 Qwen3-32B 上分别实现了 2.01 倍和 1.55 倍的端到端 wall-clock 加速;14B 峰值从 0.274 提升至 0.295。AIME 2025 实验在 4B 和 8B 上显示相同的 pass-rate 控制模式,4B 的消融实验将收益归因于重放、双向覆盖和自适应控制。
引用
@article{arxiv.2605.05112,
title = {Rollout Pass-Rate Control: Steering Binary-Reward RL Toward Its Most Informative Regime},
author = {Tianshu Zhu and Wenyu Zhang and Xiaoying Zuo and Lun Tian and Haotian Zhao and Yucheng Zeng and Jingnan Gu and Daxiang Dong and Jianmin Wu and Dawei Yin and Dou Shen},
journal= {arXiv preprint arXiv:2605.05112},
year = {2026}
}
备注
25 pages, 8 figures, 12 tables; revised formatting