评估本身经得起评估吗?一种分类器评估的第一性原理方法
机器学习
2023-02-24 v1 数据分析、统计与概率
摘要
如果尺子不符合任何标准,且其刻度随被测物而伸缩,又怎能做出有意义的测量?本文认为,当前机器学习分类器的评估实践受此类问题影响,导致分类器投入实际使用时产生本可避免的负面后果。我们建议将评估建立在决策论之上,并探讨该基础的含义。主要结果是,每个评估度量必须是混淆矩阵元素的线性组合,其系数——“效用”——依赖于具体的分类问题。对于二分类,此类可能度量的空间实质上是二维的。研究表明,准确率(precision)、平衡准确率(balanced accuracy)、马修斯相关系数(Matthews Correlation Coefficient)、Fowlkes-Mallows 指数、F1 度量以及曲线下面积(AUC)等流行度量从来不是最优的:它们总是引发原则上可避免的一部分错误评估。该比例甚至大于使用具有中等错误系数的决策论度量所导致者。
引用
@article{arxiv.2302.12006,
title = {Does the evaluation stand up to evaluation? A first-principle approach to the evaluation of classifiers},
author = {K. Dyrland and A. S. Lundervold and P. G. L. Porta Mana},
journal= {arXiv preprint arXiv:2302.12006},
year = {2023}
}
备注
36 pages, 8 figures