类别不平衡下 AUROC 与 AUPRC 的再审视
机器学习
2025-01-15 v4 统计方法学
摘要
在机器学习 (ML) 中,一个普遍的说法是,对于存在类别不平衡的任务,精确率-召回率曲线下面积 (AUPRC) 是比受试者工作特征曲线下面积 (AUROC) 更优越的模型比较指标。本文从两个方面驳斥了这一观点。首先,我们从理论上描述了在模型存在错误的情况下 AUROC 和 AUPRC 的行为,明确指出在类别不平衡的情况下,AUPRC 并非普遍更优。我们进一步表明,AUPRC 可能是一个有害的指标,因为它会不恰当地偏向于在正例标签更频繁的子群体中的模型改进,从而加剧算法差异。其次,我们使用半合成和真实世界公平性数据集上的实验,实证地支持了我们的理论。受这些见解的启发,我们对超过 150 万篇科学论文进行了回顾,以了解这一无效说法的起源,发现它经常在没有引用的情况下被提出,被错误地归因于并未论证此观点的论文,并且从原始论证中被激进地过度泛化。我们的发现代表了双重贡献:在理解 AUROC 和 AUPRC 之间关系方面取得了重大的技术进展,并对机器学习社区中未经检验的假设提出了严厉警告。
引用
@article{arxiv.2401.06091,
title = {A Closer Look at AUROC and AUPRC under Class Imbalance},
author = {Matthew B. A. McDermott and Haoran Zhang and Lasse Hyldig Hansen and Giovanni Angelotti and Jack Gallifant},
journal= {arXiv preprint arXiv:2401.06091},
year = {2025}
}
备注
NeurIPS 2024 (https://openreview.net/forum?id=S3HvA808gk)