探索标签偏差与子群规模及可分离性之间的相互作用:乳糖密度分类中的案例研究
计算机视觉与模式识别
2025-07-25 v1
摘要
系统性误标在影响特定子群(即标签偏差)的医学影像数据集中是一个鲜有人研究的公平性问题。本文研究了受标签偏差影响的子群规模和可分离性如何影响深度学习模型所学习的特征和性能。因此,我们使用EMory BrEast影像数据集(EMBED)对乳腺组织密度进行二分类深度学习模型训练,其中标签偏差影响基于影像制造商的可分离子群或非可分离的“伪子群”。我们发现,模拟的子群标签偏差导致模型所学习特征表示出现显著偏移。重要的是,这些特征空间内的偏移取决于受标签偏差影响的子群的相对规模和可分离性。我们还观察到,在是否使用标签干净的验证集来定义模型分类阈值方面,子群性能存在显著差异。例如,当标签偏差影响多数可分离子群时,若验证集标签干净,该子群的真阳性率为0.898;若验证集标签偏差,则降至0.518。我们的工作是理解医学影像AI中标签偏差对子群公平性影响的关键贡献。
引用
@article{arxiv.2507.17996,
title = {Exploring the interplay of label bias with subgroup size and separability: A case study in mammographic density classification},
author = {Emma A. M. Stanley and Raghav Mehta and Mélanie Roschewitz and Nils D. Forkert and Ben Glocker},
journal= {arXiv preprint arXiv:2507.17996},
year = {2025}
}
备注
Accepted at MICCAI Workshop on Fairness of AI in Medical Imaging (FAIMI) 2025