中文

含模糊真实标签情境下的置信度校准

机器学习 2026-03-25 v1 人工智能

摘要

置信度校准假设每个输入对应唯一的真实标签,但在标注员真正不同意的情况下,这一假设便失效。对多数投票标签进行的后验校准器在常规评估下可能看起来已校准良好,但实际上仍在标注员分布上存在显著误校准。我们表明,这一失效是结构性的:在简化假设下,温度缩放会偏向于低估标注员不确定性的温度值,随着标注熵增大,真实标签的误校准程度单调上升。为此,我们发展了一系列模糊感知的后置校准方法,通过优化对完整标签分布的正确评分规则,无需模型重新训练。我们的 methods 包含逐步弱化标注要求的方案:Dirichlet-Soft 利用完整标注分布,在各种设置下实现最佳整体校准质量;蒙特卡洛温度缩放 (MCTS S=1) 在单一标注样本的情况下即可匹配完整分布的校准效果,表明预先聚合的标签分布并非必需;标签平滑温度缩放 (LS-TS) 则仅凭投票标签通过构建数据驱动的伪软目标实现校准。实验在四个拥有真实多标注分布的数据集 (CIFAR-10H、ChaosNLI) 以及临床指导的合成标注 (ISIC~2019、DermaMNIST) 上进行,结果显示 Dirichlet-Soft 相较于温度缩放将真实标签 ECE 降低 55-87%,而 LS-TS 在无任何标注数据情况下将 ECE 降低 9-77%。

关键词

引用

@article{arxiv.2603.22879,
  title  = {Confidence Calibration under Ambiguous Ground Truth},
  author = {Linwei Tao and Haoyang Luo and Minjing Dong and Chang Xu},
  journal= {arXiv preprint arXiv:2603.22879},
  year   = {2026}
}