您的预训练大语言模型实际上是个无监督置信度校准器
机器学习
2025-11-26 v5 人工智能
摘要
后训练的大语言模型对于将预训练语言模型(PLMs)适配以人类偏好和下游任务至关重要。虽然PLMs通常表现出良好校准的置信度,但后训练语言模型(PoLMs)常常 suffer from 过度自信,为正确和错误输出都赋予高置信度,这可能削弱关键应用中的可靠性。校准PoLMs的主要障碍是稀缺的针对各个下游任务的标注数据。为此,我们提出了一种新颖的无监督方法——异议感知置信度对齐(DACA),用于优化后验置信度校准中的参数(如温度 )。本方法的动机是通过温度缩放对齐PLM和PoLM之间的置信度,而这种对齐是受到预测 disagreement 引起的低置信度问题的驱动。理论上,PLM的置信度在 disagreement 示例上低估了PoLM的预测准确性,导致较大的 ,从而产生低置信度预测。DACA通过仅选择 agreement 示例进行校准来缓解此问题,有效地解耦了 disagreement 的影响。如此一来,本方法避免了因 disagreement 示例导致的温度缩放中的过大 ,提高了校准性能。广泛的实验表明,我们的方法在常见基准测试中将开源和 API 基于的大语言模型(例如 GPT-4o)的平均 ECE 提升了最高可达 15.08%。
引用
@article{arxiv.2505.16690,
title = {Your Pre-trained LLM is Secretly an Unsupervised Confidence Calibrator},
author = {Beier Luo and Shuoyuan Wang and Sharon Li and Hongxin Wei},
journal= {arXiv preprint arXiv:2505.16690},
year = {2025}
}
备注
NeurIPS 2025