中文

面向视觉语言模型的半监督少样本适应

计算机视觉与模式识别 2026-03-04 v1

摘要

视觉语言模型(VLMs) pre-trained on large, heterogeneous data sources 正变得越来越流行,提供丰富的多模态嵌入,使其能够高效地迁移到新任务。一个特别相关的应用是少样本适应,其中仅需少量已标注示例即可通过多模态线性探针来适应模型。在医学影像领域,已显示出在零样本和少样本图像分类中取得有前景的性能,这对于缓解专家标注成本的高昂问题具有重要价值。然而,在极端低样本 regime 中仍面临挑战:医学任务中常见的类别不平衡往往导致某些类别被低估,进而惩罚整体模型性能。为解决这一限制,我们提出通过引入高效半监督求解器来利用无标签数据,在少样本适应期间传递受文本启发的伪标签。该方法使适应 VLMs 的标注预算更低, 在低样本 regime 下可将标注工作量降低超过 50%。

关键词

引用

@article{arxiv.2603.02959,
  title  = {Semi-Supervised Few-Shot Adaptation of Vision-Language Models},
  author = {Julio Silva-Rodríguez and Ender Konukoglu},
  journal= {arXiv preprint arXiv:2603.02959},
  year   = {2026}
}

备注

Code: https://github.com/jusiro/SS-Text-U