利用聚合内部信念期望增强 LLM 中的不确定性估计
计算与语言
2025-12-24 v2
摘要
大语言模型 (LLM) 在广泛的自然语言任务中取得了显著成功,但往往表现出过度自信,并生成看似合理却不正确的答案。这种过度自信(尤其是在经历了基于人类反馈的强化学习 (RLHF) 的模型中)对可靠的不确定性估计和安全部署构成了重大挑战。在本文中,我们提出了 EAGLE(聚合内部信念期望,Expectation of AGgregated internaL bEief),一种新颖的基于自评估的校准方法,该方法利用 LLM 的内部隐藏状态来推导更准确的置信度分数。我们的方法不依赖模型的最终输出,而是在自评估过程中从多个中间层提取内部信念。通过聚合这些逐层信念并计算所得置信度分数分布的期望,EAGLE 生成了一个更真实反映模型内部确定性的精炼置信度分数。在多样化数据集和 LLM 上的广泛实验表明,EAGLE 相较于现有基线显著提升了校准性能。我们还对 EAGLE 进行了深入分析,包括对不确定性模式的逐层检验、自评估提示影响的研究,以及自评估分数范围效应的分析。
引用
@article{arxiv.2509.01564,
title = {Enhancing Uncertainty Estimation in LLMs with Expectation of Aggregated Internal Belief},
author = {Zeguan Xiao and Diyang Dou and Boya Xiong and Yun Chen and Guanhua Chen},
journal= {arXiv preprint arXiv:2509.01564},
year = {2025}
}
备注
Accepted by AAAI 2026