超声图像下 BI-RADS 乳腺密度预测深度学习模型外部验证
图像与视频处理
2026-05-07 v1 计算机视觉与模式识别
摘要
我们对三个深度学习模型(DenseNet121、ViT-B/32 和 ResNet50)用于从乳腺超声检查预测乳腺密度进行外部验证。外部验证集合包括 2000 例超声检查,其中 500 例癌症病例定义为初始阴性检查(BI-RADS 1 或 2)后 6 个月至 10 年内诊断为癌症,以及 1500 例阴性对照样本,按制造商和研究年份匹配。采用患者水平 AUROC 衡量性能,涵盖四个密度类别:A(脂肪)、B(散在)、C(异质)和 D(极度密集)。作为下游评估,我们还评估将年龄和 AI 推断密度纳入 Tyrer-Cuzick 模型,并将其性能与仅使用年龄和乳腺钼诊断密度的参考模型进行比较。所有三个模型在极度密集乳腺表现最佳(AUROC 0.868-0.899),脂肪乳腚力强(0.814-0.838)和散在乳腚(0.764-0.799),异质密集乳腚性能较低(0.699-0.729)。DenseNet121 实现了最高的整体性能(micro-averaging AUROC 0.885),内部与外部测试之间的性能在各类别间相当。对于风险建模,年龄结合 AI 推断密度的 AUROC 低于年龄结合乳腺钼诊断密度(0.541 vs. 0.570; p = 0.23),无显著差异。这些发现表明,深度学习模型对具有不同种族构成的外部数据在乳腺密度评估方面具有良好可迁移性。虽然在极度密集乳腺性能最佳,但异质密集乳腺仍具有挑战性,凸显了针对性优化的必要性。
引用
@article{arxiv.2605.05082,
title = {External Validation of Deep Learning Models for BI-RADS Breast Density Prediction from Ultrasound Images},
author = {Yuxuan Chen and Arianna Bunnell and Yanqi Xu and Haoyan Yang and Thomas K. Wolfgruber and John A. Shepherd and Yiqiu Shen},
journal= {arXiv preprint arXiv:2605.05082},
year = {2026}
}
备注
Accepted at the 18th International Workshop on Breast Imaging (IWBI 2026)