ResRL:通过负样本投影残差强化学习提升LLM推理能力
机器学习
2026-05-11 v2 计算与语言
摘要
基于可验证奖励的强化学习(RLVR)通过增强大型语言模型(LLM)的推理能力,但通常因过度激励正向奖励而导致生成多样性受限。虽然负样本强化(NSR)等方法通过上调负样本的惩罚来缓解此问题,但可能抑制正负响应之间共享的语义分布。为在提升推理能力的同时保持多样性,本文提出了负样本投影残差强化学习(ResRL),通过解耦正负响应中相似的语义分布来实现。我们理论上将懒惰似然位移(LLD)关联到负正头梯度干扰,并推导出一个单前向代理上界,用于指导保守的优势重加权。ResRL随后将负样本隐藏表示投影到基于SVD的低秩正子空间中,并利用投影残差来调制负梯度,从而在保持推理能力和多样性的同时提升性能,在覆盖数学、代码、智能体任务和函数调用等十二个基准测试上平均 outperform strong baselines。值得注意的是,ResRL在数学推理方面在Avg@16上提升9.4%,在Pass@128上提升7.0%。代码已公开:https://github.com/1229095296/ResRL.git
引用
@article{arxiv.2605.00380,
title = {ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning},
author = {Zihan Lin and Xiaohan Wang and Jie Cao and Jiajun Chai and Li Wang and Xiaodong Lu and Wei Lin and Ran He and Guojun Yin},
journal= {arXiv preprint arXiv:2605.00380},
year = {2026}
}
备注
Accepted to ICML 2026. Preprint version. https://github.com/1229095296/ResRL.git