分类器概率校准指标综合综述
机器学习
2025-04-28 v1 机器学习
摘要
人工智能(AI)和机器学习(ML)模型产生的概率或置信值往往不反映其真实准确性,部分模型可能高估或低估自身预测的可靠性。例如,当模型对某一结果有80%的把握时,它是否真的在80%的时间下正确?概率校准指标衡量置信度与准确性之间的偏差,为模型校准性能提供独立评估,补充传统准确性指标。理解校准在多个系统输出组合、确保安全或业务关键情境中的可靠性,以及建立用户对模型信任方面都至关重要。本文提供了分类器和目标检测模型概率校准指标的综合综述,依据多种不同分类方式进行组织,以突出它们之间的关系。我们识别出82个主要指标,可分为四类分类器家族(基于点的、基于箱的、基于核或基于曲线的,以及累计型)以及一个目标检测家族。对于每个指标,我们提供可用的情况下的公式,便于未来研究者的实现和比较。
引用
@article{arxiv.2504.18278,
title = {A comprehensive review of classifier probability calibration metrics},
author = {Richard Oliver Lane},
journal= {arXiv preprint arXiv:2504.18278},
year = {2025}
}
备注
60 pages, 7 figures