基于无配对图像和文本的语言引导无监督适应能否提高医学图像分类?
计算机视觉与模式识别
2025-04-01 v2
摘要
在医学图像分类中,监督学习面临标签医学图像稀缺的挑战。为此,我们利用视觉-文本模型 (VLM) 中的视觉-文本对齐,实现医学图像分类器的无监督学习。在本工作中,我们提出了 \underline{Med}ical \underline{Un}supervised \underline{A}daptation (\texttt{MedUnA}) 方法,其中将每个类的 LLM 生成描述编码为文本嵌入并通过跨模态适配器与类别标签匹配。该适配器附加到 \texttt{MedCLIP} 的视觉编码器上,通过无监督学习对视觉嵌入进行对齐,该学习由基于对比熵的损失和 prompt tuning 驱动。从而在文本信息丰富于标记图像的场景中提升性能,尤其是在医疗保健领域。不同于传统 VLM,\texttt{MedUnA} 使用 \textbf{无配对图像和文本} 进行表示学习,并超越传统约束释放 VLM 的潜能。我们在三个胸 X 光数据集和两个多类别数据集 (糖尿病视网膜病变和皮肤瘤) 上进行评估,结果表明相对于零样基线实现了显著的准确率提升。我们的代码可在 https://github.com/rumaima/meduna 获取。
引用
@article{arxiv.2409.02729,
title = {Can language-guided unsupervised adaptation improve medical image classification using unpaired images and texts?},
author = {Umaima Rahman and Raza Imam and Mohammad Yaqub and Boulbaba Ben Amor and Dwarikanath Mahapatra},
journal= {arXiv preprint arXiv:2409.02729},
year = {2025}
}
备注
Conference paper at International Symposium on Biomedical Imaging (ISBI) 2025