中文

MMCLIP:用于医学语言-图像预训练的跨模态注意力掩码建模

计算机视觉与模式识别 2025-04-17 v4

摘要

医学领域的视觉-语言预训练(VLP)利用图像-文本对进行对比学习,以实现跨任务的有效迁移。然而,当前的 VLP 方法在医学领域应用面临两个挑战:首先,当前模型难以准确重建因医学数据稀缺而导致的关键病理特征;其次,大多数方法仅采用配对图像-文本或图像-文本数据,无法利用两者的组合。为此,本文提出了 MMCLIP(Masked Medical Contrastive Language-Image Pre-Training)框架,通过无配对数据增强病理学习和特征学习。首先,我们引入注意力掩码图像建模(AttMIM)和实体驱动的掩码语言建模模块(EntMLM),通过多模态特征交互学习重建病理视觉和文本标记,从而提高医学增强特征。AttMIM 模块掩码一部分对文本特征高度敏感的图像特征,这使 MMCLIP 能够提高医学领域中高度相似图像数据的重建效率。其次,我们的 MMCLIP 利用无配对数据通过引入疾病类别提示词来增强多模态学习。实验结果表明,MMCLIP 在五个数据集上的零样分类和微调分类性能均实现了 SOTA。我们的代码将在 https://github.com/AIGeeksGroup/MMCLIP 上公开。

关键词

引用

@article{arxiv.2407.19546,
  title  = {MMCLIP: Cross-modal Attention Masked Modelling for Medical Language-Image Pre-Training},
  author = {Biao Wu and Yutong Xie and Zeyu Zhang and Minh Hieu Phan and Qi Chen and Ling Chen and Qi Wu},
  journal= {arXiv preprint arXiv:2407.19546},
  year   = {2025}
}