人工智能模型在筛查乳腺摄影中性能差距的多变量分析
摘要
尽管用于异常分类的深度学习模型在筛查乳腺摄影中表现良好,但与模型失败风险增加相关的人口统计学、影像学和临床特征仍不清楚。本回顾性研究使用 Emory BrEast Imaging Dataset (EMBED),该数据集包含 2013-2020 年间在 Emory Healthcare 接受影像检查的 115931 名患者的乳腺摄影图像,具有 BI-RADS 评估、异常区域坐标、影像特征、病理结果和患者人口统计学信息。训练了多个深度学习模型以区分筛查乳腺摄影中的异常组织块与随机选取的正常组织块。我们按年龄、种族、病理结果、组织密度和影像特征定义的亚组评估模型性能,并研究它们与假阴性 (FN) 和假阳性 (FP) 的关联。我们还进行了多变量逻辑回归以控制亚组间的混杂。性能最佳的模型 ResNet152V2 达到了 92.6%(95%CI=92.0-93.2%) 的准确率和 0.975(95%CI=0.972-0.978) 的 AUC。在控制混杂前,几乎所有亚组都显示出统计学显著的模型性能差异。然而,控制混杂后,我们发现较低的 FN 风险与 Other 种族 (RR=0.828;p=.050)、活检证实的良性病变 (RR=0.927;p=.011)、肿块 (RR=0.921;p=.010) 或不对称 (RR=0.854;p=.040) 相关;较高的 FN 风险与结构扭曲相关 (RR=1.037;p<.001)。较高的 FP 风险与 BI-RADS 密度 C (RR=1.891;p<.001) 和 D (RR=2.486;p<.001) 相关。我们的结果表明亚组分析在乳腺摄影分类器性能评估中十分重要,且控制亚组间混杂能阐明变量与模型失败间的真实关联。这些结果有助于指导未来乳腺癌检测模型的开发。
引用
@article{arxiv.2305.04422,
title = {Multivariate Analysis on Performance Gaps of Artificial Intelligence Models in Screening Mammography},
author = {Linglin Zhang and Beatrice Brown-Mulry and Vineela Nalla and InChan Hwang and Judy Wawira Gichoya and Aimilia Gastounioti and Imon Banerjee and Laleh Seyyed-Kalantari and MinJae Woo and Hari Trivedi},
journal= {arXiv preprint arXiv:2305.04422},
year = {2023}
}
备注
29 pages, 6 tables, 7 figures, 2 supplemental tables