RLVR 中基于自适应负面强化的 LLM 推理:动态平衡纠错与多样性
机器学习
2026-05-11 v1 人工智能
摘要
基于可验证奖励的强化学习 (Reinforcement Learning with Verifiable Rewards, RLVR) 已成为提高大型语言模型 (Large Language Model, LLM) 推理能力的高效方法。最近的研究表明,负面样本强化 (Negative Sample Reinforcement, NSR) ——即聚焦惩罚错误步骤而非仅奖励正确步骤——可在整个 Pass@k 意义上匹配甚至超越 PPO 和 GRPO 等更复杂框架。然而,当前的 NSR 技术通常在整个训练过程中应用固定惩罚,且对每一次错误响应采用相同权重。为此,我们提出了两项 NSR 框架的扩展:自适应负面样本强化 (Adaptive Negative Sample Reinforcement, A-NSR)。不同于固定更新规则,A-NSR 使用随时间变化的调度函数。在初始训练阶段,系统重点纠正错误以稳定模型;随着训练继续,它转向更细致且受控的更新。我们还引入置信度加权负面强化 (Confidence-Weighted Negative Reinforcement, CW-NSR),其运作原理是不同错误的重要性不同。CW-NSR 根据模型归一化序列概率为错误分配特定惩罚权重:如果模型对错误路径高度自信,则获得更大惩罚;而对于不确定的错误——即模型实际在探索——则惩罚更宽松。我们的形式化分析展示了这些机制如何支配 token 级更新,使模型能够在先验指导下进行概率重新分配,同时提供对过拟合的自然防御。我们在困难推理数据集上评估了这些方法,包括 MATH、AIME 2025 和 AMC23,使用 Qwen2.5-Math-1.5B 架构。
引用
@article{arxiv.2605.07137,
title = {Adaptive Negative Reinforcement for LLM Reasoning:Dynamically Balancing Correction and Diversity in RLVR},
author = {Yash Ingle and Jaival Chauhan and Ankit Yadav and Sudhakar Mishra},
journal= {arXiv preprint arXiv:2605.07137},
year = {2026}
}