中文

重评估机器学习模型校准比较与改进的方法

机器学习 2025-02-25 v2 统计理论 机器学习 统计理论

摘要

若机器学习模型的预测概率与该预测条件下的观察频率相匹配,则称该模型已校准。作为机器学习模型影响范围不断扩大的事实,校准属性变得越来越重要。因此,近年来关于衡量和改进(具体指深度学习模型)校准的论文数量也随之激增。本文重新评估了近期文献中校准指标的报告方式。我们指出,存在一些简单的再校准方法,除非伴随校准指标和预测指标(即测试准确率)之外,便会显得似乎领先于其他方法。我们随后利用基于 Bregman 发散的校准分解,发展出一种新的可视化方法,用于联合展示校准与泛化误差,并展示了该可视化方法如何用于检测校准与泛化之间的权衡。我们在此过程中证明了关于完整校准误差与置信度校准误差之间关系的新结果。我们还确立了我们可视化方法中用于校准误差估计的核回归估计器的一致性,这扩展了文献中现有一致性结果。

关键词

引用

@article{arxiv.2406.04068,
  title  = {Reassessing How to Compare and Improve the Calibration of Machine Learning Models},
  author = {Muthu Chidambaram and Rong Ge},
  journal= {arXiv preprint arXiv:2406.04068},
  year   = {2025}
}

备注

ICLR 2025, 29 pages, 14 figures