中文

负强化在 LLM 推理中令人惊讶的有效性

计算与语言 2025-10-28 v2 机器学习

摘要

带有可验证奖励的强化学习(RLVR)是一种在推理任务上训练语言模型(LM)以引发涌现的长思维链的有前途的方法。与监督学习不同,它通过策略梯度利用正确和错误的样本来更新模型。为了更好地理解其机制,我们将学习信号分解为强化正确响应和惩罚错误响应,分别称为正样本强化(PSR)和负样本强化(NSR)。我们在数学推理数据集上训练 Qwen2.5-Math-7B、Qwen3-4B 和 Llama-3.1-8B-Instruct,并揭示了一个令人惊讶的结果:仅用负样本训练——不强化正确响应——可以非常有效:它在整个 Pass@kk 谱(kk 高达 256)上持续提高基模型的性能,通常匹配或超越 PPO 和 GRPO。相比之下,仅强化正确响应可改善 Pass@1,但由于多样性降低,在较高 kk 值时会降低性能。这些推理缩放趋势表明,仅惩罚错误响应可能对性能的贡献比以前认识的更大。通过梯度分析,我们表明 NSR 通过抑制错误的生成并在模型先验信念的引导下将概率质量重新分配给其他合理候选者来发挥作用。它精炼了模型的现有知识,而不是引入全新的行为。基于这一见解,我们提出了一个上调 NSR 权重的 RL 目标的简单变体,并表明它在 MATH、AIME 2025 和 AMC23 上持续改善了整体 Pass@kk 性能。我们的代码可在 https://github.com/TianHongZXY/RLVR-Decomposed 获取。

关键词

引用

@article{arxiv.2506.01347,
  title  = {The Surprising Effectiveness of Negative Reinforcement in LLM Reasoning},
  author = {Xinyu Zhu and Mengzhou Xia and Zhepei Wei and Wei-Lin Chen and Danqi Chen and Yu Meng},
  journal= {arXiv preprint arXiv:2506.01347},
  year   = {2025}
}

备注

Accepted to NeurIPS 2025