中文

跨多个低剂量CT数据集的肺结节检测与恶性病灶分类可复现基准测试

计算机视觉与模式识别 2026-02-10 v5 人工智能 机器学习 图像与视频处理

摘要

评估人工智能(AI)模型用于低剂量CT肺癌筛查受限于异构数据集、标注标准和评估协议,使其在临床环境中的性能难以比较和转化。我们建立了一个面向肺结节检测和结节级癌症分类的公共、可复现的多数据集基准测试,并量化了跨数据集的泛化能力。以Duke Lung Cancer Screening(DLCS)数据集作为临床精选的开发集,我们在LUNA16/LIDC-IDRI、NLST-3D和LUNA25上评估性能。对检测模型在NLST-3D上的外部评估采用自由响应ROC分析。对于恶性病灶分类,我们比较了五种策略:随机初始化的ResNet50、Models Genesis、Med3D、面向癌症生物标志物的基础模型,以及基于检测派生的候选补片按置信度分层的战略性热启动(ResNet50-SWS)方法。结果使用AUC及95%置信区间和DeLong检验总结。检测性能因训练数据集而异,DLCS训练模型在外部NLST-3D评估中优于LUNA16训练模型(在每扫描2个假阳性处的灵敏度:0.72 vs. 0.64; p < 0.001)。对于恶性病灶分类,ResNet50-SWS在DLCS、LUNA16、NLST-3D和LUNA25上的AUC分别为0.71、0.90、0.81和0.80,始终匹配或优于其他预训练策略。这些结果表明,数据集特征对肺癌AI性能具有强大影响,凸显了透明、多数据集基准测试的必要性。

关键词

引用

@article{arxiv.2405.04605,
  title  = {Reproducible Benchmarking for Lung Nodule Detection and Malignancy Classification Across Multiple Low-Dose CT Datasets},
  author = {Fakrul Islam Tushar and Avivah Wang and Lavsen Dahal and Ehsan Samei and Michael R. Harowicz and Jayashree Kalpathy-Cramer and Kyle J. Lafata and Tina D. Tailor and Cynthia Rudin and Joseph Y. Lo},
  journal= {arXiv preprint arXiv:2405.04605},
  year   = {2026}
}

备注

3 tables, 2 supplement tables, 5 figures