中文

CalArena:大规模后验校准基准

机器学习 2026-05-29 v1 人工智能 机器学习

摘要

可靠的概率估计在众多机器学习应用中至关重要,但现代分类器往往校准性差。后验校准提供一种简单且广泛使用的解决方案,但大量方法的存在,以及小规模且评估不一致,使得难以确定哪些方法在实际中 truly effective。我们引入一个大规模、标准化的后验校准基准,覆盖近 2000 个实验,涵盖表格和计算机视觉任务,包括二分类、多分类和大规模分类场景。我们的基准汇聚了多样化的经典模型、现代深度学习架构和基础模型的预测,并在统一、可复现的实现框架中提供数十种校准方法。我们认为,后验改进 (Post-Hoc Improvement, PHI) 以 proper scoring rules 为基准的替代方案,优于传统校准误差估计器,既捕捉校准质量,又反映模型预测性能的潜在退化。通过该框架,我们进行了目前为止最全面的后验校准实证研究。我们的结果揭示了跨域一致模式:光滑校准函数优于基于分箱的方法,专门的多分类方法在高维情形下至关重要,通用机器学习模型在无校准特定设计时并不具竞争力。为促进未来研究,我们公开所有数据、代码和评估工具,提供一个即插即用的数据集,用于开发和比较校准方法。

关键词

引用

@article{arxiv.2605.30188,
  title  = {CalArena: A Large-Scale Post-Hoc Calibration Benchmark},
  author = {Eugène Berta and David Holzmüller and Francis Bach and Michael I. Jordan},
  journal= {arXiv preprint arXiv:2605.30188},
  year   = {2026}
}

备注

30 pages, 9 figures