基于 CLIP 的组织学图像分类配对框架 CLIP-IT
计算机视觉与模式识别
2025-11-26 v5
摘要
多模态学习在医学影像中展现出前景,通过结合图像和文本等互补模态来实现。视觉-语言模型(VLM)能够捕获丰富的诊断线索,但通常需要大量配对数据集和基于提示或文本的推理,限制了其实际应用 due to 标注成本、隐私和计算需求。关键在于,现有的免费非配对外部文本(如病理报告)仍可为每个图像提供可检索的相关诊断线索。为此,我们引入 CLIP-IT,一种新型框架,依赖丰富的非配对文本报告。具体而言,CLIP-IT 使用在其他数据集上预训练的 CLIP 模型,用于检索每个下游无监督数据集图像的最相关未配对文本报告。这些报告来自同一疾病领域和组织类型,形成反映共享临床语义(而非精确对齐)的伪配对。训练期间,这些文本的知识被蒸馏到视觉模型中,同时采用 LoRA-based 适配技术来缓解非对齐模态之间的语义差距。在推理阶段,仅使用视觉模型即可完成推理,保持开销低廉,同时仍能从无需下游数据集配对数据的多模态训练中受益。在组织学图像数据集上的实验表明,CLIP-IT 在大多数情况下均优于基于 CLIP 的单模态和多模态基线方法提高分类准确率,且无需每组数据集的配对标注或推理时的复杂性。
引用
@article{arxiv.2504.16181,
title = {CLIP-IT: CLIP-based Pairing for Histology Images Classification},
author = {Banafsheh Karimian and Giulia Avanzato and Soufian Belharbi and Alexis Guichemerre and Luke McCaffrey and Mohammadhadi Shateri and Eric Granger},
journal= {arXiv preprint arXiv:2504.16181},
year = {2025}
}