中文

MedFocusCLIP: 利用像素级注意力改进医学数据集中的少样本分类

图像与视频处理 2025-01-08 v1 计算机视觉与模式识别

摘要

随着基础模型的流行,参数高效微调已成为利用预训练模型执行下游任务的事实标准方法。受大语言模型、视觉提示调优及类似技术最新进展的启发,我们学习额外的提示以高效微调预训练的视觉基础模型。然而,我们观察到这种提示对于细粒度视觉分类任务(如医学图像分类,其中类间方差大、类内方差小)是不够的。因此,在本文中,我们提出利用Segment Anything Model 2 (SAM2)的先进分割能力作为视觉提示线索,通过引导CLIP视觉编码器中的注意力关注图像中的相关区域,来帮助视觉编码器。这有助于模型聚焦于高判别性区域,而不被视觉上相似的背景特征分散注意力,这是少样本细粒度分类场景中的一项基本要求。我们在包括X光、CT扫描和MRI图像在内的多种医学数据集上评估了我们的方法,并报告了所提方法在(COVID、肺病、脑肿瘤、乳腺癌)数据集上的准确率分别为(71%、81%、86%、58%),而预训练CLIP模型在少样本训练后的准确率为(66%、70%、68%、29%)。所提方法还允许通过分割获得的定位结果,为分类性能提供可解释的解释。

关键词

引用

@article{arxiv.2501.03839,
  title  = {MedFocusCLIP : Improving few shot classification in medical datasets using pixel wise attention},
  author = {Aadya Arora and Vinay Namboodiri},
  journal= {arXiv preprint arXiv:2501.03839},
  year   = {2025}
}