中文

ConfTuner:训练大语言模型以口头表达其置信度

计算与语言 2025-11-26 v2 人工智能

摘要

大语言模型(LLM)越来越多地部署在科学、法律和医疗保健等高风险领域,在这些领域中,准确表达不确定性对于可靠性和信任至关重要。然而,当前的 LLM 经常被观察到生成高置信度的错误答案,这种现象被称为“过度自信”。最近的研究工作集中于校准 LLM 的口头化置信度:即它们以文本形式表达的置信度,例如“我有 80% 的把握……”。现有方法要么依赖于提示工程,要么使用启发式生成的不确定性估计进行微调,这两种方法的有效性和泛化能力都有限。受经典机器学习模型中用于校准的适当评分规则概念的启发,我们引入了 ConfTuner,这是一种简单高效的微调方法,它引入的开销极小,且不需要真实的置信度分数或代理置信度估计。ConfTuner 依赖于一种新的损失函数——分词化 Brier 分数,我们从理论上证明了它是一个适当的评分规则,直观上意味着它“正确地激励模型报告其正确的真实概率”。ConfTuner 改进了跨多种推理任务的校准,并能泛化到 GPT-4o 等黑盒模型。我们的结果进一步表明,校准更好的置信度能够在自我纠正和模型级联方面带来下游增益,从而推动可信赖 LLM 系统的发展。代码可在 https://github.com/liushiliushi/ConfTuner 获取。

关键词

引用

@article{arxiv.2508.18847,
  title  = {ConfTuner: Training Large Language Models to Express Their Confidence Verbally},
  author = {Yibo Li and Miao Xiong and Jiaying Wu and Bryan Hooi},
  journal= {arXiv preprint arXiv:2508.18847},
  year   = {2025}
}

备注

Accepted by NeurIPS 2025