中文

评估与校准具有多个正确答案问题的大语言模型置信度

计算与语言 2026-02-10 v1

摘要

置信校准是使大语言模型(LLM)可靠的关键任务,而现有基于无训练的方法主要是在单答案问答场景下进行研究。本文表明,这些方法在存在多个有效答案时会失效,其中等价正确响应之间的不一致导致置信度系统性低估。为支持对这一现象的系统性研究,我们引入 MACE(Multi-Answer Confidence Evaluation),这是一个包含 12,000 个涵盖六个领域、答案数量各异的事实性问题的基准数据集。实验覆盖 15 个代表性校准方法和 4 个 LLM 族(7B-72B),结果表明尽管准确率随答案基数增加而提升,但估计的置信度却持续下降,导致在混合答案计数的题目上出现严重的误校准。为解决此问题,我们提出了语义置信聚合(SCA)方法,通过聚合多个高概率采样响应的置信度来实现校准。SCA 在混合答案场景下实现了置信校准的状态最佳性能,同时在单答案题目上保持良好的校准表现。

关键词

引用

@article{arxiv.2602.07842,
  title  = {Evaluating and Calibrating LLM Confidence on Questions with Multiple Correct Answers},
  author = {Yuhan Wang and Shiyu Ni and Zhikai Ding and Zihang Zhan and Yuanzi Li and Keping Bi},
  journal= {arXiv preprint arXiv:2602.07842},
  year   = {2026}
}