Virtual-Eyes:面向基础模型癌症风险预测的肺部 CT 质量控制流程的定量验证
摘要
在用于低剂量 CT (LDCT) 肺癌筛查的深度学习流程中,稳健的预处理很少被量化。我们开发并验证了 Virtual-Eyes,一个临床驱动的 16 位 CT 质量控制流程,并测量了其对通用基础模型与专用模型的不同影响。Virtual-Eyes 强制要求严格的 512x512 平面内分辨率,拒绝过短或非诊断性的序列,并通过亨氏单位过滤和双侧肺覆盖评分提取连续的肺块,同时保留原生的 16 位数据格式。使用 765 名 NLST 患者(182 名癌症患者,583 名非癌症患者),我们利用冻结编码器的 RAD-DINO 和 Merlin 计算切片级嵌入,并训练无泄漏的患者级 MLP 头;我们还评估了 Sybil 和 2D ResNet-18 基线模型在原始输入与 Virtual-Eyes 输入下的表现,且未对骨干网络进行重新训练。Virtual-Eyes 将 RAD-DINO 的切片级 AUC 从 0.576 提高到 0.610,患者级 AUC 从 0.646 提高到 0.683(均值池化)和从 0.619 提高到 0.735(最大池化),同时校准度得到改善(Brier 分数从 0.188 降至 0.112)。相比之下,Sybil 和 ResNet-18 在 Virtual-Eyes 下性能下降(Sybil AUC 从 0.886 降至 0.837;ResNet-18 AUC 从 0.571 升至 0.596),显示出上下文依赖和捷径学习的证据,而 Merlin 无论预处理如何,都表现出有限的可迁移性(AUC 约在 0.507 至 0.567 之间)。这些结果表明,解剖学导向的质量控制可以稳定并改善通用基础模型的工作流程,但可能会破坏适应原始临床环境的专用模型。
引用
@article{arxiv.2512.24294,
title = {Virtual-Eyes: Quantitative Validation of a Lung CT Quality-Control Pipeline for Foundation-Model Cancer Risk Prediction},
author = {Md. Enamul Hoq and Linda Larson-Prior and Fred Prior},
journal= {arXiv preprint arXiv:2512.24294},
year = {2026}
}
备注
23 pages, and Under Review-MIDL-2026