中文

直接置信度对齐:将大语言模型的口头置信度与内部置信度对齐

计算与语言 2025-12-16 v1

摘要

随着大语言模型(LLM)使用的广泛,其生产可信赖且可靠的输出变得越来越重要。校准旨在通过提高模型置信度与实际正确性或可取性之间的对齐度来实现这一目标。然而,已观察到模型的内部置信度(源自token概率)与其口头置信度(verbalized confidence)对齐度不佳,导致不同的校准方法产生误导性结果。本文提出了直接置信度对齐(Direct Confidence Alignment, DCA)方法,利用直接偏好优化(Direct Preference Optimization)将LLM的口头置信度与其内部置信度对齐,而非与真实正确性对齐,从而通过确保两种置信度度量之间更接近的对齐来提高模型的透明度和可靠性。我们在多个开源LLM上进行广泛数据集的评估。为进一步评估这种对齐,我们还引入了三个新的基于校准误差的指标。我们的结果表明,DCA在某些模型架构上提高了对齐指标,减少了模型置信度表达中的不一致性。然而,我们也表明在其他模型上可能效果不佳,这凸显了在追求更可解释和可信赖的LLM方面,仍需更加关注模型特性的方法。

关键词

引用

@article{arxiv.2512.11998,
  title  = {Direct Confidence Alignment: Aligning Verbalized Confidence with Internal Confidence In Large Language Models},
  author = {Glenn Zhang and Treasure Mayowa and Jason Fan and Yicheng Fu and Aaron Sandoval and Sean O'Brien and Kevin Zhu},
  journal= {arXiv preprint arXiv:2512.11998},
  year   = {2025}
}

备注

Accepted at ACL 2025 SRW, 5 pages body, 14 pages total