医学图像分析中的性能不确定性:置信区间的大规模调查
计算机视觉与模式识别
2026-01-27 v1 机器学习
摘要
性能不确定性量化对于可靠的验证及最终的临床转化至关重要。置信区间(CI)在这一过程中发挥着核心作用,通过指示报告的性能估计有多么精确来实现。然而,由于缺乏对CI行为进行广泛考察的工作,社区基本上不了解存在多少种多样化的CI方法以及它们在特定情景下的行为。本研究旨在弥合这一差距。为此,我们在总计24个分割和分类任务上进行了大规模实证分析,每个任务组使用19个训练好的模型,涵盖广泛的常用性能指标、多种聚合策略以及几种广泛采用的CI方法。我们估计每种CI方法在所有设置下的可靠性(覆盖率)和精确性(宽度),以刻画其对研究特征的依赖性。我们的分析揭示了五个主要发现:1)用于可靠CI的样本量因研究参数而言,从几十个到数千个不等;2)CI行为受性能指标选择的强烈影响;3)聚合策略对CI的可靠性有显著影响,例如宏观CI需要更多观察值而微观CI则相对较少;4)机器学习问题(分割与分类)调制这些效应;5)不同的CI方法在特定用例下可靠性和精确性并非一致。这些结果构成了开发医学图像AI报告性能不确定性指南的关键要素。
引用
@article{arxiv.2601.17103,
title = {Performance uncertainty in medical image analysis: a large-scale investigation of confidence intervals},
author = {Pascaline André and Charles Heitz and Evangelia Christodoulou and Annika Reinke and Carole H. Sudre and Michela Antonelli and Patrick Godau and M. Jorge Cardoso and Antoine Gilson and Sophie Tezenas du Montcel and Gaël Varoquaux and Lena Maier-Hein and Olivier Colliot},
journal= {arXiv preprint arXiv:2601.17103},
year = {2026}
}