中文

MLIP:基于掩码局部表示学习的医学语言-图像预训练

计算机视觉与模式识别 2024-01-04 v1

摘要

现有的对比语言-图像预训练旨在通过匹配丰富的图像-文本对来学习联合表示。然而,医学数据集中图像-文本对的数量通常比自然数据集少几个数量级。此外,医学图像-文本对常涉及大量复杂的细粒度对应关系。本文旨在通过引入多对多的局部关系建模来捕获更密集的监督信号,从而提高数据效率。具体来说,我们提出了一个医学语言-图像预训练(MLIP)框架,该框架通过图像块-句子匹配更高效地利用有限的图像-文本医学数据。此外,我们引入了一种带有语义完整性估计的掩码对比学习策略,以减少图像中的冗余同时保留底层语义。我们的评估结果表明,MLIP在零/少样本分类和少样本分割任务中大幅优于先前的工作。

关键词

引用

@article{arxiv.2401.01591,
  title  = {MLIP: Medical Language-Image Pre-training with Masked Local Representation Learning},
  author = {Jiarun Liu and Hong-Yu Zhou and Cheng Li and Weijian Huang and Hao Yang and Yong Liang and Shanshan Wang},
  journal= {arXiv preprint arXiv:2401.01591},
  year   = {2024}
}

备注

5 pages, 3 figures