中文

置信区间大揭秘:我们是否准备好迎接现实世界的医学影像AI了?

计算机视觉与模式识别 2024-09-30 v2 人工智能 机器学习

摘要

医学影像正引领着AI在医疗保健领域的变革。性能报告是确定哪些方法应用于临床实践的关键因素。频繁地仅从平均性能值中得出广泛结论,这种做法常常是误导性的简化,因其忽略了性能变异性。我们的贡献有三个方面。(1)分析所有2023年发表于MICCAI会议的分割论文(共221篇),我们首先发现超过50%的论文根本没有评估性能变异性。此外,仅有一篇(0.5%)的论文报告了模型性能的置信区间(CI)。(2)为解决报告瓶颈,我们表明分割论文中未报告的标准差(SD)可以用均值Dice相似系数(DSC)的二次多项式函数近似。基于来自56个以前MICCAI挑战赛的外部验证数据,我们演示,这种近似方法可以准确重建使用出版物中提供的信息的CI。(3)我们重建了MICCAI 2023分割论文均值DSC的95%置信区间。中位数CI宽度为0.03,仅为第一名方法与第二名方法性能差值的三倍。对于超过60%的论文,第二名方法的平均性能位于第一名方法的CI内。我们得出结论,当前期刊发表的论文通常不提供足够的证据来支持哪些模型可能被转化为临床实践。

关键词

引用

@article{arxiv.2409.17763,
  title  = {Confidence intervals uncovered: Are we ready for real-world medical imaging AI?},
  author = {Evangelia Christodoulou and Annika Reinke and Rola Houhou and Piotr Kalinowski and Selen Erkan and Carole H. Sudre and Ninon Burgos and Sofiène Boutaj and Sophie Loizillon and Maëlys Solal and Nicola Rieke and Veronika Cheplygina and Michela Antonelli and Leon D. Mayer and Minu D. Tizabi and M. Jorge Cardoso and Amber Simpson and Paul F. Jäger and Annette Kopp-Schneider and Gaël Varoquaux and Olivier Colliot and Lena Maier-Hein},
  journal= {arXiv preprint arXiv:2409.17763},
  year   = {2024}
}

备注

Paper accepted at MICCAI 2024 conference