测试集AUROC的奇特案例
机器学习
2023-12-29 v1 统计方法学
摘要
尽管过去十年中机器学习模型的规模和复杂性迅速显著增长,但评估其性能的方法却未能跟上步伐。特别是,在众多潜在的性能指标中,机器学习社区仍然固执地使用(a)验证和测试队列(与训练数据不同)的接收者操作特征曲线下面积(AUROC),或(b)在从验证ROC确定的最优阈值下测试数据的敏感性和特异性。然而,我们认为仅考虑从测试ROC曲线得出的分数只能提供对模型性能及其泛化能力的狭窄洞察。
引用
@article{arxiv.2312.16188,
title = {The curious case of the test set AUROC},
author = {Michael Roberts and Alon Hazan and Sören Dittmer and James H. F. Rudd and Carola-Bibiane Schönlieb},
journal= {arXiv preprint arXiv:2312.16188},
year = {2023}
}
备注
3 pages, 4 figures