深度学习在筛查性乳腺摄影中的问题和捷径
计算机视觉与模式识别
2023-03-30 v1 机器学习
定量方法
摘要
本工作揭示了深度学习模型性能与泛化性中未被发现的挑战。我们(1)识别了会虚增性能的伪捷径与评估问题,(2)提出了解决这些问题的训练与分析方法。我们在一个回顾性数据集上训练了一个 AI 模型以分类癌症,该数据集包含 2008 至 2017 年获取的 120,112 例美国检查(3,467 例癌症)和 2011 至 2015 年获取的 16,693 例英国检查(5,655 例癌症)。我们在筛查性乳腺摄影测试集上评估:11,593 例美国检查(102 例癌症;7,594 名女性;年龄 57.1 \pm 11.0)和 1,880 例英国检查(590 例癌症;1,745 名女性;年龄 63.3 \pm 7.2)。一个仅在视图标记图像(无乳腺)上训练的模型达到了 0.691 的 AUC。在原两个数据集上训练的模型在美英合并数据集上达到了 0.945 AUC,但矛盾的是在美国和英国数据集上分别仅有 0.838 和 0.892。训练时从两数据集中均衡抽样癌症缓解了此捷径。在评估诊断性检查与筛查性检查时(分别为 0.862 与 0.861),出现了类似的 AUC 悖论(0.903)。训练时移除诊断性检查减轻了此偏置。最后,模型在扫描仪型号上未表现出 AUC 悖论,但仍表现出对 Selenia Dimension(SD)检查优于 Hologic Selenia(HS)检查的偏置。分析表明,当某数据集属性具有更高癌症患病率(数据集偏置)且模型随之对该属性值赋予更高概率(模型偏置)时,发生此 AUC 悖论。分层与平衡癌症患病率可缓解评估中的捷径。数据集与模型偏置会引入捷径和 AUC 悖论,这可能是医疗 AI 领域普遍存在的问题。我们的方法可验证并缓解捷径,同时提供对性能的清晰理解。
引用
@article{arxiv.2303.16417,
title = {Problems and shortcuts in deep learning for screening mammography},
author = {Trevor Tsue and Brent Mombourquette and Ahmed Taha and Thomas Paul Matthews and Yen Nhi Truong Vu and Jason Su},
journal= {arXiv preprint arXiv:2303.16417},
year = {2023}
}