中文

SeLIP:面向多模态头脑MRI的相似性增强对抗语言图像预训练

计算机视觉与模式识别 2025-03-26 v1 人工智能

摘要

尽管深度学习方法在许多医学图像分析任务中展现出巨大潜力,但由于缺乏带有手动标注的数据样本,医学深度学习模型的实际应用受到限制。我们注意到临床放射科检查与放射科报告相关联,而后者描述了图像内容。因此,我们提出开发一种基于图像和相应放射科发现(reports)之间的对比学习的多模态头脑MRI基础模型。具体而言,提出一种对比学习框架,其中集成了混合语法和语义相似性匹配指标,以减少传统对比学习框架对极大数据集的需求。我们提出的相似性增强对抗语言图像预训练(SeLIP)能够有效提取更多有用特征。实验表明,我们提出的SeLIP在许多下游任务中表现良好,包括图像-文本检索任务、分类任务和图像分割,突显了在开发医学图像基础模型时考虑描述不同图像的文本之间相似性的重要性。

关键词

引用

@article{arxiv.2503.19801,
  title  = {SeLIP: Similarity Enhanced Contrastive Language Image Pretraining for Multi-modal Head MRI},
  author = {Zhiyang Liu and Dong Yang and Minghao Zhang and Hanyu Sun and Hong Wu and Huiying Wang and Wen Shen and Chao Chai and Shuang Xia},
  journal= {arXiv preprint arXiv:2503.19801},
  year   = {2025}
}