肺癌筛查风险估计模型的公平性评估
摘要
肺癌是全球成人癌症死亡的主要原因。通过年输送低剂量CT(LDCT)筛查高危人群可支持更早的检测并减少死亡,但广泛实施可能加剧已受限放射科 workforce 的压力。AI模型在从LDCT扫描中估计肺癌风险方面显示出潜力。然而,肺癌的高危人群具有多样性,这些模型在不同人口学群体中的表现仍是未知问题。本研究依据JustEFAB框架中对混杂因素和伦理显著偏差的考虑,对两种深度学习风险估计模型进行公平性评估,以肺癌筛查为背景:Sybil肺癌风险模型和Venkadesh21肺结节风险估计器。我们还检查了被推荐用于英国胸部学会结节管理指南中的PanCan2b逻辑回归模型。两种深度学习模型均在美国基于肺癌筛查试验(NLST)的数据上训练,并在保留的NLST验证集上进行评估。我们在不同人口学子组之间评估了AUROC、灵敏度和特异度,并探讨了临床风险因素的潜在混杂作用。我们观察到Sybil模型在女性(0.88,95% CI: 0.86, 0.90)和男性(0.81,95% CI: 0.78, 0.84,p < .001)之间的AUROC存在统计学显著差异。在90%特异度下,Venkadesh21对Black人群的灵敏度(0.39,95% CI: 0.23, 0.59)低于White人群(0.69,95% CI: 0.65, 0.73)。这些差异未被可用的临床混杂因素解释,因此可根据JustEFAB准则归类为不公平偏差。我们的发现凸显了改进和监控 underrepresented子群体中模型性能的重要性,以及肺癌筛查中算法公平性进一步研究的必要性。
引用
@article{arxiv.2512.22242,
title = {Fairness Evaluation of Risk Estimation Models for Lung Cancer Screening},
author = {Shaurya Gaur and Michel Vitale and Alessa Hering and Johan Kwisthout and Colin Jacobs and Lena Philipp and Fennie van der Graaf},
journal= {arXiv preprint arXiv:2512.22242},
year = {2025}
}
备注
Accepted for publication at the Journal of Machine Learning for Biomedical Imaging (MELBA) https://melba-journal.org/2025:025