奖励怀疑:一种用于大语言模型校准置信度表达的强化学习方法
计算与语言
2026-03-03 v6 人工智能
摘要
安全且可信地使用大语言模型(LLM)需要其对答案表达准确的置信度。我们提出了一种新颖的强化学习方法,允许直接微调 LLM,使其在回答事实性问题时表达校准的置信度估计。我们的方法优化了基于对数评分规则的奖励,明确惩罚过度自信和自信不足。这鼓励模型将其置信度估计与实际预测准确性对齐。在我们的奖励设计下,最优策略将产生完美校准的置信度表达。与先前将置信度估计与响应生成解耦的方法不同,我们的方法将置信度校准无缝集成到 LLM 的生成过程中。在实验中,我们证明了使用我们的方法训练的模型表现出显著改善的校准效果,并且无需进一步微调即可泛化到未见任务,这表明出现了通用的置信度意识。
引用
@article{arxiv.2503.02623,
title = {Rewarding Doubt: A Reinforcement Learning Approach to Calibrated Confidence Expression of Large Language Models},
author = {David Bani-Harouni and Chantal Pellegrini and Paul Stangel and Ege Özsoy and Kamilia Zaripova and Nassir Navab and Matthias Keicher},
journal= {arXiv preprint arXiv:2503.02623},
year = {2026}
}