通过探测扰动表示稳定性校准 LLM 置信度
计算与语言
2025-09-22 v2
摘要
大语言模型(LLMs)的误校准削弱了其可靠性,凸显了准确置信度估计的必要性。我们引入了 CCPS(通过探测扰动表示稳定性校准 LLM 置信度),一种分析 LLMs 内部表示稳定性的新颖方法。CCPS 对最终隐藏状态施加有针对性的对抗扰动,提取反映模型对这些扰动响应的特征,并使用轻量级分类器预测答案的正确性。CCPS 在参数量从 8B 到 32B 的 LLMs 上进行了评估(涵盖 Llama、Qwen 和 Mistral 架构),使用 MMLU 和 MMLU-Pro 基准,包含选择题和开放式格式。结果表明,CCPS 显著优于现有方法。在四个 LLM 和三个 MMLU 变体上,与最强的现有方法相比,CCPS 将 Expected Calibration Error 降低了约 55%,Brier score 降低了 21%,同时准确率提高了 5 个百分点,Precision-Recall Curve 下面积提高了 4 个百分点,Receiver Operating Characteristic Curve 下面积提高了 6 个百分点。CCPS 为估计 LLM 置信度提供了一个高效、广泛适用且更准确的解决方案,从而提高了其可信度。
引用
@article{arxiv.2505.21772,
title = {Calibrating LLM Confidence by Probing Perturbed Representation Stability},
author = {Reza Khanmohammadi and Erfan Miahi and Mehrsa Mardikoraem and Simerjot Kaur and Ivan Brugere and Charese H. Smiley and Kundan Thind and Mohammad M. Ghassemi},
journal= {arXiv preprint arXiv:2505.21772},
year = {2025}
}