中文

MedCLIP:来自非配对医学图像与文本的对比学习

计算机视觉与模式识别 2022-10-20 v1 计算与语言

摘要

现有的视觉-文本对比学习如 CLIP 旨在匹配成对的图片与描述嵌入,同时将其他样本推远,从而提升表征可迁移性并支持零样本预测。然而,医学图像-文本数据集的规模比互联网上的通用图像与描述低数个数量级。此外,先前方法遇到许多假负样本,即来自不同患者的图像与报告可能承载相同语义却被错误地当作负样本。本文中,我们将图像与文本解耦以进行多模态对比学习,从而以低成本组合式地扩大可用训练数据规模。我们还提出基于医学知识的语义匹配损失来替代 InfoNCE 损失,以消除对比学习中的假负样本。我们证明 MedCLIP 是一个简洁而有效的框架:它在零样本预测、监督分类和图像-文本检索上优于当前最优方法。令人惊讶的是,我们观察到仅使用 20K 预训练数据,MedCLIP 便胜过了当前最优方法(使用约 200K 数据)。我们的代码见 https://github.com/RyanWangZf/MedCLIP。

关键词

引用

@article{arxiv.2210.10163,
  title  = {MedCLIP: Contrastive Learning from Unpaired Medical Images and Text},
  author = {Zifeng Wang and Zhenbang Wu and Dinesh Agarwal and Jimeng Sun},
  journal= {arXiv preprint arXiv:2210.10163},
  year   = {2022}
}

备注

EMNLP 2022