中文

BaseCal:基于基础模型信号的无监督置信度校准

计算与语言 2026-05-12 v4

摘要

可靠的置信度对于信任LLM的输出至关重要,但广泛部署的后训练LLM(PoLLM)通常以严重的过度自信为代价,削弱了这种信任。相较之下,我们注意到其对应的基础LLM往往保持良好的校准程度。这自然催生了将PoLLM置信度校准为基础LLM的参考。本工作提出了实现这一目标的两种方法。最直接的方案是BaseCal-ReEval,通过将PoLLM的响应输入基础LLM以获取平均概率作为置信度。虽然有效,但该方法引入额外的推理开销。为此,我们提出BaseCal-Proj,通过训练轻量级投影将PoLLM的最终隐藏状态映射回其基础LLM的隐藏状态。这些投影后的状态随后被处理以由基础LLM的输出层,以获得PoLLM响应的基础校准置信度。值得注意的是,BaseCal是一种无监督、即插即用的解决方案,无需人工标签或LLM修改。在五个数据集和三个LLM系列的实验中,我们证明了BaseCal的有效性,使期望校准误差(ECE)平均降低42.90%。

关键词

引用

@article{arxiv.2601.03042,
  title  = {BaseCal: Unsupervised Confidence Calibration via Base Model Signals},
  author = {Hexiang Tan and Wanli Yang and Junwei Zhang and Xin Chen and Rui Tang and Du Su and Jingang Wang and Yuanzhuo Wang and Fei Sun and Xueqi Cheng},
  journal= {arXiv preprint arXiv:2601.03042},
  year   = {2026}
}

备注

ACL 2026 Main