典型医学图像分割任务的性能估计有多精确?
计算机视觉与模式识别
2023-05-25 v3 定量方法
应用统计
摘要
医学图像处理中的一个重要问题是,不仅要能够估计算法的性能,还要能够估计这些性能估计的精确度。报告精确度通常等同于报告均值标准误(SEM)或等价的置信区间。然而,这在医学图像分割研究中很少被做到。在本文中,我们旨在估计在此类研究中可以期望的典型置信度。为此,我们首先使用标准深度学习模型(U-net)和来自 Medical Segmentation Decathlon 的经典任务,进行了 Dice 指标估计的实验。我们利用高斯假设和自助法(bootstrapping,不需要对分布作任何假设)广泛研究了精确度估计。然后,我们对其他测试集大小和性能分布进行了模拟。总体而言,我们的工作表明,小测试集会导致宽的置信区间(例如,在 且样本数为 20 时,Dice 约为 8 个百分点)。
引用
@article{arxiv.2210.14677,
title = {How precise are performance estimates for typical medical image segmentation tasks?},
author = {Rosana El Jurdi and Olivier Colliot},
journal= {arXiv preprint arXiv:2210.14677},
year = {2023}
}