MaskedCLIP:用于半监督医学视觉语言预训练的掩码与CLIP空间桥接
计算机视觉与模式识别
2025-07-24 v1
摘要
基础模型最近在医学图像分析中获得了巨大的热潮。领先的方法利用配对图像-文本数据通过视觉语言预训练,或利用非配对图像数据通过自监督预训练来学习具通用图像特征的基础模型,以提升下游任务性能。然而,仅在配对或非配对图像数据上学习基础模型限制了其学习更丰富、更全面图像特征的能力。本文我们探索一种新颖的任务,称为半监督视觉语言预训练,旨在充分利用配对和非配对图像数据的潜力来学习基础模型。为此,我们提出了 MaskedCLIP,一个集成掩码图像建模和对抗语言-图像预训练框架,用于半监督视觉语言预训练。将配对和非配对图像数据用于学习基础模型的关键挑战在于这两种数据类型派生的特征空间不兼容。为解决此问题,我们提出将掩码特征空间与 CLIP 特征空间通过一个桥接变换器连接。如此一来,来自更具语义特定性的 CLIP 特征即可从更通用的掩码特征中受益,以实现语义特征提取。我们进一步提出了一个掩码知识蒸馏损失,将原始图像特征在 CLIP 特征空间中的语义知识蒸馏到掩码特征空间中预测的掩码图像特征中。通过这种相互互动的设计,我们的框架有效地利用了配对和非配对图像数据来学习更通用、更具可 generalization 能力的图像特征,以适应下游任务。大量实验在视网膜图像分析上表明了我们方法的有效性和数据效率。
引用
@article{arxiv.2507.17239,
title = {MaskedCLIP: Bridging the Masked and CLIP Space for Semi-Supervised Medical Vision-Language Pre-training},
author = {Lei Zhu and Jun Zhou and Rick Siow Mong Goh and Yong Liu},
journal= {arXiv preprint arXiv:2507.17239},
year = {2025}
}
备注
Accepted to MedAGI 2025 (Oral)