中文

少样本,现在动真格:无需平衡集或验证集的医学 VLM 适配

计算机视觉与模式识别 2025-06-24 v1

摘要

视觉语言模型 (VLMs) 在医学图像分析中正受到越来越多的关注。这些模型在大规模异构数据源上预训练,产生丰富且可迁移的表示。值得注意的是,模态专用 VLM 与少样本适配相结合已取得丰硕成果,实现了高性能解决方案的高效部署。然而,先前关于该主题的工作对适配数据的分布做出了强假设,这在医学领域是不切实际的。首先,现有技术假设可以访问平衡的支持集,这一条件打破了真实场景中疾病患病率自然存在的失衡状态。其次,这些工作通常假设存在额外的验证集来固定关键超参数,这极大地降低了数据效率。本研究挑战了这些理想的部署场景,并引入了一种现实的、不平衡的、无需验证的适配设置。我们在各种模态和下游任务上进行了广泛基准测试,结果表明当前方法在现实条件下运行时,其性能会系统性地受损,偶尔甚至比零样本推理表现更差。此外,我们引入了一种无需训练的线性探针,能够自适应地融合视觉与文本监督。详细研究表明,所提出的求解器是一个强大且高效的基线,能够在具有挑战性的场景中实现稳健适配。

关键词

引用

@article{arxiv.2506.17500,
  title  = {Few-Shot, Now for Real: Medical VLMs Adaptation without Balanced Sets or Validation},
  author = {Julio Silva-Rodríguez and Fereshteh Shakeri and Houda Bahig and Jose Dolz and Ismail Ben Ayed},
  journal= {arXiv preprint arXiv:2506.17500},
  year   = {2025}
}

备注

MICCAI 2025. Code: https://github.com/jusiro/SS-Text