中文

ConfClip:用于 LLM 中强化学习的置信度加权与奖励裁剪技术

机器学习 2025-09-23 v1 计算与语言

摘要

强化学习(RL)已成为超越预训练和指令调优对大型语言模型(LLM)进行细化的标准范式。其中一类方法是基于可验证奖励(RLVR)的 RL,利用自动可验证的结果(如正确性或可执行性)生成奖励信号。虽然该框架高效,但面临两个关键局限:其一,其二元反馈稀疏得无法捕捉推理过程的质量;其二,其粗粒度奖励可能导致梯度消失。受人类学习观察的启发,我们引入一种 RL 技术,将可验证结果与模型自身置信度估计相结合。这种联合设计丰富了奖励信号,提供更细粒度的反馈,并隐式监督推理过程。实验结果表明,我们提出的方法在多个数据集上提升了 RL 性能,推理时减少了 token 消耗,同时增加的训练成本可忽略不计。此外,该方法可作为增强其他最新 RL 方法的插件模块。

关键词

引用

@article{arxiv.2509.17730,
  title  = {ConfClip: Confidence-Weighted and Clipped Reward for Reinforcement Learning in LLMs},
  author = {Bonan Zhang and Zhongqi Chen and Bowen Song and Qinya Li and Fan Wu and Guihai Chen},
  journal= {arXiv preprint arXiv:2509.17730},
  year   = {2025}
}