基于连续提示的统一医学图像-文本-标签对比学习
图像与视频处理
2023-07-13 v1 计算机视觉与模式识别
机器学习
摘要
对比语言-图像预训练(CLIP)[13] 可利用大规模无标注的图像-文本对数据集,已在各种下游任务中展现出令人印象深刻的性能。鉴于医学数据标注耗时费力,图像-文本预训练在利用大规模医学影像与放射报告数据集方面具有广阔应用前景。然而,医学图像-文本预训练面临若干挑战: (1) 由于隐私问题,可用医学数据量相较自然数据较小,导致模型泛化能力较弱。 (2) 医学图像高度相似,仅在细微处存在细粒度差异,导致对比学习中大量假阴性样本对。 (3) 手工设计的提示通常与自然医学影像报告不符,措辞的细微变化可导致性能显著差异。本文中,我们提出一种基于连续提示的统一图像-文本-标签对比学习框架,主要有三点贡献。首先,我们将图像、文本和标签数据统一,极大扩展了模型可利用的训练数据。其次,我们通过引入连续隐式提示,解决了数据多样性及手工提示对模型性能影响的问题。最后,我们提出图像-文本-标签对比训练以缓解假阴性样本过多的问题。我们通过充分实验证明,统一医学对比学习(UMCL)框架在多个下游任务上表现出优异性能。
引用
@article{arxiv.2307.05920,
title = {Unified Medical Image-Text-Label Contrastive Learning With Continuous Prompt},
author = {Yuhao Wang},
journal= {arXiv preprint arXiv:2307.05920},
year = {2023}
}