Quality Sentinel:估计医学分割数据集中的标签质量与错误
计算机视觉与模式识别
2024-06-04 v1
摘要
越来越多的公开数据集对自动医学分割产生了变革性影响。然而,这些数据集通常具有不同的标签质量,从手动专家注释到AI生成的伪注释。缺乏系统、可靠和自动的质量控制(QC)。为了填补这一空白,我们引入了一个回归模型Quality Sentinel,用于估计医学分割数据集中标签质量与手动注释的比较。该回归模型在我们创建的超过400万图像-标签对上进行了训练。每个对呈现基于手动注释的变化但量化的标签质量,这使我们能够预测推理中任何图像-标签对的标签质量。我们的Quality Sentinel可以预测142个身体结构的标签质量。通过Dice相似系数(DSC)量化的预测标签质量与真实质量具有很强的相关性,正相关系数r=0.902。Quality Sentinel发现了多个有影响力的用例。(I)我们评估了公开可用数据集中的标签质量,不同数据集之间的质量差异很大。我们的分析还发现,男性和年轻受试者的质量显著更高。(II)我们识别并纠正了标注不佳的标签,在TotalSegmentator上通过最优预算实现了注释成本降低1/3。(III)我们通过关注高质量伪标签提高了AI训练效率和性能,与基于熵的方法相比,性能提升33%--88%,而时间成本仅为31%,内存成本为4.5%。数据和模型已发布。
引用
@article{arxiv.2406.00327,
title = {Quality Sentinel: Estimating Label Quality and Errors in Medical Segmentation Datasets},
author = {Yixiong Chen and Zongwei Zhou and Alan Yuille},
journal= {arXiv preprint arXiv:2406.00327},
year = {2024}
}
备注
13 pages, 6 figures, 3 tables