中文

重新审视大型语言模型的不确定性估计与校准

计算与语言 2025-06-02 v1 人工智能 机器学习

摘要

随着大型语言模型(LLM)越来越多地部署在高风险应用中,鲁棒的不确定性估计对于确保 LLM 安全可信的部署至关重要。我们提出了迄今为止最全面的 LLM 不确定性估计研究,评估了 80 个模型,涵盖开源和闭源系列、稠密和混合专家架构、推理和非推理模式、量化变体以及从 0.6B 到 671B 的参数规模。聚焦于三种具有代表性的黑盒单遍方法,包括基于 token 概率的不确定性(TPU)、数值语言不确定性(NVU)和语言语言不确定性(LVU),我们使用涵盖推理密集型和知识型任务的挑战性 MMLU-Pro 基准,系统地评估了不确定性校准和选择性分类。我们的结果表明,LVU 始终优于 TPU 和 NVU,提供更强的校准和区分度,同时更具可解释性。我们还发现,高准确率并不意味着可靠的不确定性,且模型规模、后训练、推理能力和量化都会影响估计性能。值得注意的是,LLM 在推理任务上比在知识密集型任务上表现出更好的不确定性估计,而良好的校准并不必然转化为有效的错误排序。这些发现突出了多视角评估的必要性,并将 LVU 定位为提高 LLM 在真实场景中可靠性的实用工具。

关键词

引用

@article{arxiv.2505.23854,
  title  = {Revisiting Uncertainty Estimation and Calibration of Large Language Models},
  author = {Linwei Tao and Yi-Fan Yeh and Minjing Dong and Tao Huang and Philip Torr and Chang Xu},
  journal= {arXiv preprint arXiv:2505.23854},
  year   = {2025}
}