中文

关注置信度差距: 大语言模型中的过度自信、校准与干扰效应

计算与语言 2025-12-15 v3 人工智能

摘要

大语言模型(LLM)在自然语言任务上表现出显著的熟练度,但其频繁的过度自信——即预测置信度与真实正确性之间的错位——在关键决策应用中构成重大风险。我们对九个 LLM 和三个事实性问答(QA)数据集上的校准进行了全面分析,系统比较了标准自由生成设置与结构化干扰增强提示。我们的评估表明,显式引入干扰可以显著缓解校准不良,在相对准确率上实现高达 460% 的提升,在期望校准误差(ECE)上实现高达 90% 的降低。尽管存在总体趋势,但我们发现了细微的发现:大型 RLHF 调优模型具有固有的校准优势,但在较简单查询上反而可能出现更严重的校准不良,而较小模型从干扰提示中获益不成比例地大,但仍存在显著的校准不良。通过对问题类型的详细分析,我们识别出持续的校准失败,特别是在基于人物的查询中。我们以具体建议——针对性微调、结构化提示和策略性模型选择——作为结论,以确保可靠、可信赖的 LLM 部署。

关键词

引用

@article{arxiv.2502.11028,
  title  = {Mind the Confidence Gap: Overconfidence, Calibration, and Distractor Effects in Large Language Models},
  author = {Prateek Chhikara},
  journal= {arXiv preprint arXiv:2502.11028},
  year   = {2025}
}

备注

Published in Transactions on Machine Learning Research (TMLR)