不要浪费错误:通过置信度重加权利用负强化学习组
机器学习
2025-10-13 v1
摘要
带可验证奖励的强化学习(RLVR)已成为改进大型语言模型(LLM)推理任务的标准方法,其中组相对策略优化(GRPO)在实践中被广泛使用。然而,GRPO 在负组上浪费了大量计算:没有采样响应正确的组产生零优势,因此没有梯度。我们提出疑问,是否可以在没有额外监督的情况下利用负组。从奖励建模中的最大似然(MLE)目标出发,我们证明了 MLE 梯度等价于修正值函数的策略梯度。该值函数对不正确的响应增加了置信度加权惩罚,对更自信的错误施加更大的惩罚。我们将其称为**负样本似然估计**(**LENS**)。LENS 修改了 GRPO,为不正确的生成分配非零的、依赖于置信度的奖励,使负组变得信息丰富,并将以前浪费的样本转化为有用的梯度更新。在 MATH 基准测试中,使用 Llama-3.1-8B 和 Qwen-2.5-3B,所提出的变体始终优于 GRPO 基线,在更难的题目上取得了显著提升。这些结果证明了一种有原则且实用的“拯救”负组的方法,提高了 RLVR 的效率和性能。
关键词
引用
@article{arxiv.2510.08696,
title = {Don't Waste Mistakes: Leveraging Negative RL-Groups via Confidence Reweighting},
author = {Yunzhen Feng and Parag Jain and Anthony Hartshorn and Yaqi Duan and Julia Kempe},
journal= {arXiv preprint arXiv:2510.08696},
year = {2025}
}