中文

测试集AUROC的奇特案例

机器学习 2023-12-29 v1 统计方法学

摘要

尽管过去十年中机器学习模型的规模和复杂性迅速显著增长,但评估其性能的方法却未能跟上步伐。特别是,在众多潜在的性能指标中,机器学习社区仍然固执地使用(a)验证和测试队列(与训练数据不同)的接收者操作特征曲线下面积(AUROC),或(b)在从验证ROC确定的最优阈值下测试数据的敏感性和特异性。然而,我们认为仅考虑从测试ROC曲线得出的分数只能提供对模型性能及其泛化能力的狭窄洞察。

关键词

引用

@article{arxiv.2312.16188,
  title  = {The curious case of the test set AUROC},
  author = {Michael Roberts and Alon Hazan and Sören Dittmer and James H. F. Rudd and Carola-Bibiane Schönlieb},
  journal= {arXiv preprint arXiv:2312.16188},
  year   = {2023}
}

备注

3 pages, 4 figures