中文

面向长尾医学图像分类的文本引导基石模型适应

计算机视觉与模式识别 2024-08-28 v1

摘要

在医疗领域,由于稀有疾病标签稀缺导致长尾数据集分布不平衡,严重影响深度学习模型的诊断准确性。最近出现的多模态文本图像监督的基石模型通过有效的表征学习提供了解决数据稀缺的新方法。然而,其在医学特定的预训练有限,导致其在医学图像分类任务中不及自然图像。为此,我们提出一种 novel 的方法——面向长尾医学图像分类的文本引导基石模型适应(TFA-LT)。我们采用两阶段训练策略,仅通过两个线性适配器和一个单一的集成器即可整合基石模型的表征,实现平衡的结果。在两个长尾医学图像数据集上的实验结果验证了该方法的简洁性、轻量级和高效性:仅使用当前最佳算法的 6.1% GPU 内存,本方法在准确率上提升了最高可达 27.1%,凸显了基石模型适应在该领域的巨大潜力。

关键词

引用

@article{arxiv.2408.14770,
  title  = {Text-guided Foundation Model Adaptation for Long-Tailed Medical Image Classification},
  author = {Sirui Li and Li Lin and Yijin Huang and Pujin Cheng and Xiaoying Tang},
  journal= {arXiv preprint arXiv:2408.14770},
  year   = {2024}
}

备注

Accepted by IEEE ISBI 2024