用于增强 CT 图像理解的大规模细粒度视觉语言预训练
计算机视觉与模式识别
2025-01-27 v1
摘要
人工智能 (AI) 在帮助放射科医生提高医学图像解读和诊断效率与准确性方面显示出巨大的潜力。然而,灵活的 AI 模型需要大规模数据和全面标注,而这些在医疗环境中往往难以实现。最近的研究利用放射科报告作为天然的高质量监督信号,对医学图像进行对比式语言-图像预训练 (CLIP),开发出面向放射学图像解读的语言感知模型。然而,这些方法通常将整个图像与报告进行对比,忽略了图像区域与报告句子之间的局部关联,这可能削弱模型性能和可互操作性。本文提出了一种细粒度视觉-语言模型 (fVLM) 用于解剖学级别的 CT 图像解读。具体而言,我们显式地将 CT 图像的解剖区域与放射科报告中的对应描述进行匹配,并对每个解剖结构 individually 进行对比预训练。细粒度对齐面临显著的假负样本挑战,主要来自大量解剖级别的健康样本和类似的疾病性 abnormalities。为解决此问题,我们提出了识别正常和异常样本的假负样本并从患者水平调整到疾病感知配对进行对比学习。我们收集了目前为止最大规模的 CT 数据集,包含来自 69,086 名患者的影像和报告数据,并对 15 个主要解剖结构上的 54 项主要重要疾病诊断任务进行了全面评估。实验结果表明,fVLM 在通用医学图像解读方面的潜力巨大。在零样本分类任务中,我们在 54 项诊断任务上实现了平均 AUC 为 81.3%,分别超过 CLIP 和监督方法各 12.9% 和 8.0%。
引用
@article{arxiv.2501.14548,
title = {Large-scale and Fine-grained Vision-language Pre-training for Enhanced CT Image Understanding},
author = {Zhongyi Shui and Jianpeng Zhang and Weiwei Cao and Sinuo Wang and Ruizhe Guo and Le Lu and Lin Yang and Xianghua Ye and Tingbo Liang and Qi Zhang and Ling Zhang},
journal= {arXiv preprint arXiv:2501.14548},
year = {2025}
}
备注
Accepted by ICLR 2025