中文

RadCLIP:通过对比语言-图像预训练提升放射学图像分析

计算机视觉与模式识别 2025-05-30 v3 人工智能

摘要

人工智能 (AI) 与放射学的集成标志着医学的一个变革性时代。视觉基础模型已被采用来增强放射学影像分析。然而,放射学二维和三维数据的独特复杂性构成了独特挑战,而现有在一般非医学图像上预训练的模型未能充分应对。为弥合这一差距并利用放射学影像诊断中所需的精确度,我们引入放射学对比语言-图像预训练 (RadCLIP):一种基于对比语言-图像预训练 (CLIP) 的跨模态视觉-语言基础模型,旨在提高放射学图像分析水平。RadCLIP 采用针对体积图像分析的切片池化机制,并使用放射学图像-文本对的大型多样数据集进行预训练。RadCLIP 被预训练以有效对齐放射学图像及其相应文本注释,构建放射学图像的稳健视觉主干网络。大量实验表明,RadCLIP 在单模态放射学图像分类和跨模态图像-文本匹配方面均表现出优越性能,凸显其在临床环境中提高诊断准确性和效率的巨大潜力。我们的主要贡献包括:构建包含多样化二维/三维放射学图像-文本对的大型数据集、针对集成二维图像的注意力机制设计的切片池化适配器,以及对 RadCLIP 在各种放射学下游任务上的全面评估。

关键词

引用

@article{arxiv.2403.09948,
  title  = {RadCLIP: Enhancing Radiologic Image Analysis through Contrastive Language-Image Pre-training},
  author = {Zhixiu Lu and Hailong Li and Nehal A. Parikh and Jonathan R. Dillman and Lili He},
  journal= {arXiv preprint arXiv:2403.09948},
  year   = {2025}
}