你的度量指标在告诉你什么?基于情境特定可靠性定义的分类器校准评估
机器学习
2022-05-24 v1
摘要
分类器校准近期受到机器学习界的关注,既因其在实际辅助决策中的实用价值,也因现代神经网络分类器校准不良的观察。已有大量工作以实现输出中幅值最大者("预测类别")被校准为目标。然而,这种对分类器输出的狭隘解读未能充分涵盖分类器可辅助决策的多样实际用例。本文主张,必须开发更具表达力的度量指标,以准确衡量分类器将部署的特定情境下的校准误差。为此,我们利用期望校准误差(ECE)的推广形式推导了若干不同度量,用以在多种可靠性定义下衡量校准误差。随后,我们针对这些度量对常用神经网络架构与校准技术进行了广泛的实证评估。我们发现:1)仅关注预测类别的ECE定义,在若干实际有用的可靠性定义下无法准确衡量校准误差;2)许多常见校准技术在这些源于不同可靠性定义的ECE度量上未能一致地改善校准性能。
引用
@article{arxiv.2205.11454,
title = {What is Your Metric Telling You? Evaluating Classifier Calibration under Context-Specific Definitions of Reliability},
author = {John Kirchenbauer and Jacob Oaks and Eric Heim},
journal= {arXiv preprint arXiv:2205.11454},
year = {2022}
}
备注
Accepted in the ICLR 2022 Machine Learning Evaluation Standards Workshop