中文

医学视觉语言模型的 Few-shot 适应

计算机视觉与模式识别 2024-09-09 v1

摘要

通过多模态学习将图像和文本数据集成已成为医学影像研究中的新方法,紧随其后的是在计算机视觉中的成功应用。尽管已致力于建立医学基础模型及其零样态迁移到下游任务,但流行的 few-shot 设定仍相对未被探索。紧随当前在计算机视觉中强劲涌现的趋势,我们引入了第一个为适应医学视觉语言模型 (VLMs) 在严格 few-shot 场景中建立的结构化基准,并探讨了在自然图像上下文中常用的各种适应策略。此外,我们评估了一种简单地对线性探针适应基线的推广,即寻求视觉原型和文本嵌入之间通过可学习的类别相关性乘子进行最优混合。意外的是,此种基于文本信息的线性探针在性能上与复杂的 prompt-learning 和 adapter-based 策略相当,同时运行速度更快,且适用于黑盒场景。我们的广泛实验涵盖三个不同的医学模态、九个下游任务以及多个最新的 few-shot 适应方法。我们将基准和代码公开于 https://github.com/FereshteShakeri/few-shot-MedVLMs,以触发该新兴领域的进一步发展。

关键词

引用

@article{arxiv.2409.03868,
  title  = {Few-shot Adaptation of Medical Vision-Language Models},
  author = {Fereshteh Shakeri and Yunshi Huang and Julio Silva-Rodríguez and Houda Bahig and An Tang and Jose Dolz and Ismail Ben Ayed},
  journal= {arXiv preprint arXiv:2409.03868},
  year   = {2024}
}

备注

MICCAI 2024 (Spotlight) - Code is available at https://github.com/FereshteShakeri/few-shot-MedVLMs.git