利用组 rollouts 中的误差多样性提升强化学习中的奖励优势
机器学习
2026-05-19 v1
摘要
从可验证奖励进行的强化学习(RLVR)通常对每个提示抽取多个响应,并基于 individual 正确性分配二元奖励,但对 group 输出的整体结构——即误差分布—— largely 被忽略。我们识别出这一被忽略的机会:经验分析表明,组内误差多样性是训练成功的强预测因子,导致多样化错误的题目在 RLVR 中受益显著大于产生均质错误的题目。鼓舞此观察后,我们提出了一种轻量级、无算法依赖的技术,即误差多样性优势塑形(EDAS),该技术基于组内误差多样性调制错误 rollouts 的优势信号。EDAS 放大主导、重复误差的惩罚,同时减弱稀有、探索性错误的惩罚,从而鼓励模型保持多样化的推理路径,并抑制误差固化。重要的是,EDAS 作为一种简单的事后调整,可无缝集成到任何 RLVR 算法中。我们在多个主流 RLVR 方法上进行验证,涵盖多种模型和七个具有挑战性的数学基准,结果表明提升持续可靠。值得注意的是,EDAS 在 Qwen3-8B 上相对于 DAPO 在七个基准上平均提升 6.29 分,确认了利用 group rollouts 中潜在信息是强化 RLVR 的通用有效策略。
引用
@article{arxiv.2605.17333,
title = {Leveraging Error Diversity in Group Rollouts for Reinforcement Learning},
author = {Wenpu Liu and Yuqi Xu and Weichu Xie and Yongfu Zhu and Shuai Dong and Ziyue Wang and Wenqi Shao and Xiaoying Zhang and Tong Yang and Nan Duan and Jiaqi Wang},
journal= {arXiv preprint arXiv:2605.17333},
year = {2026}
}