中文

将置信度用作奖励:将大语言模型转化为奖励模型

人工智能 2025-10-16 v1

摘要

奖励模型可以显著提升大型语言模型(LLM)的推理能力,但它们通常需要大量精选数据和高昂的训练成本。为缓解这些挑战,训练自由方法如 LLM-as-a-Judge 利用 LLM 内在的推理能力来评估回答,取得了令人鼓舞的结果。近期研究也表明,模型置信度可作为有效的奖励指标,区分链律思(chain-of-thought, CoT)与非 CoT 路径。然而,将置信度用作奖励的概念尚未得到系统性研究。本文我们系统性地探讨了置信度即奖励(Confidence-as-a-Reward, CRew),这是一种简单却强大的训练自由方法,利用模型最终答案中单元级置信度作为奖励的代理,尤其适用于封闭式任务。通过对数学推理任务的大量实验,我们展示了 CRew 在 MATH500 和 RewardMATH 基准上超越现有训练自由奖励方法,甚至优于大多数训练型奖励模型。我们进一步发现,CRew 分数与模型实际推理性能之间存在强相关性。此外,我们发现 CRew 可有效筛选高质量训练数据。基于这些洞见,我们提出了 CRew-DPO,一种从置信度分数结合正确性信号构建偏好数据的训练策略。使用 CRew-DPO 进行微调可进一步提升模型的判别能力,并持续优于现有自训练方法。

关键词

引用

@article{arxiv.2510.13501,
  title  = {Confidence as a Reward: Transforming LLMs into Reward Models},
  author = {He Du and Bowen Li and Chengxing Xie and Chang Gao and Kai Chen and Dacheng Tao},
  journal= {arXiv preprint arXiv:2510.13501},
  year   = {2025}
}