中文

支持医疗决策的预测式 AI 模型性能评估:综述与指南

机器学习 2024-12-16 v1 统计方法学 机器学习

摘要

文献中已提出大量用于说明预测式人工智能 (AI) 模型性能的指标。为用于医疗实践而开发的预测式 AI 模型选择合适的性能指标至关重要,因为性能不佳的模型可能会伤害患者并导致成本增加。我们旨在评估经典与当代性能指标在验证用于医疗实践的预测式 AI 模型时的优劣。我们关注具有二元结果的结果模型。我们讨论了涵盖五个性能领域(区分度、校准度、总体、分类和临床效用)的 32 项性能指标及相关的图形评估。前四个领域涵盖统计性能,第五个领域涵盖决策分析性能。我们解释了为何在选择评估哪些性能指标时,两个关键特征很重要:(1) 该指标的期望值是否在使用正确概率计算时被最优化(即“严格 Proper”指标),以及 (2) 它们是否通过适当考虑误分类成本来反映纯统计性能或决策分析性能。17 项指标具备这两个特征,14 项指标具备其中一个特征,1 项指标均不具备(F1 指标)。所有分类指标(如分类准确率和 F1)对于不同于 0.5 或患病率的临床相关决策阈值均是不 Proper 的。我们建议将以下指标和图表作为必须报告的内容:AUROC、校准图、临床效用指标(如净收益与决策曲线分析),以及按结果类别展示概率分布的图表。

关键词

引用

@article{arxiv.2412.10288,
  title  = {Performance evaluation of predictive AI models to support medical decisions: Overview and guidance},
  author = {Ben Van Calster and Gary S. Collins and Andrew J. Vickers and Laure Wynants and Kathleen F. Kerr and Lasai Barreñada and Gael Varoquaux and Karandeep Singh and Karel G. M. Moons and Tina Hernandez-boussard and Dirk Timmerman and David J. Mclernon and Maarten Van Smeden and Ewout W. Steyerberg},
  journal= {arXiv preprint arXiv:2412.10288},
  year   = {2024}
}

备注

60 pages, 8 tables, 11 figures, two supplementary appendices