中文

学习在何处观察:面向 3D CT 的疾病感知视觉语言预训练

计算机视觉与模式识别 2026-03-03 v1 计算与语言 机器学习

摘要

最近的 3D CT 视觉语言模型通过对比式预训练将体数据与报告对齐,但通常依赖有限的公开数据且仅提供粗糙的全局监督。我们在 98k 条报告-体数据对(5万名患者)上训练 3D CT 视觉语言模型,这些数据来自单一医院收集,并结合公开数据集,采用 SigLIP 风格的对比式预训练,同时在共享的视觉-文本嵌入空间中使用基于提示的疾病监督。实验表明,在 CT-RATE 数据集上,我们的方法在文本到图像检索(R@10 提升至 31.5% vs. 22.2%)和疾病分类(AUC 达 83.8% vs. 83.8%)方面实现了最前沿的性能,在 Rad-ChestCT 上也表现出竞争力(AUC 77.0% vs. 77.3%)。进一步我们发现,放射科医生在撰写报告时会常规地引用具体图像(如“series X, image Y”),将文本描述与精确的轴向位置关联。我们自动挖掘出 26.2k 条片段-切片对,引入片段内定位任务——预测文本片段所指的轴向深度——在 12mm 分辨率下将平均绝对误差降至 36.3mm(相较于最佳基线的 67.0mm)。增加该定位目标后,检索和分类在置信区间内基本保持不变,最终构建了一个统一的模型,同时支持检索、分类和片段内定位。

关键词

引用

@article{arxiv.2603.02026,
  title  = {Learning to Read Where to Look: Disease-Aware Vision-Language Pretraining for 3D CT},
  author = {Simon Ging and Philipp Arnold and Sebastian Walter and Hani Alnahas and Hannah Bast and Elmar Kotter and Jiancheng Yang and Behzad Bozorgtabar and Thomas Brox},
  journal= {arXiv preprint arXiv:2603.02026},
  year   = {2026}
}