中文

多模态 CLIP 推断用于元少样本图像分类

计算机视觉与模式识别 2024-05-21 v1

摘要

在近期文献中,少样本分类主要由 N way k-shot 元学习问题所定义。为此目的设计的模型通常在遵循受限设置(不使用外部数据)的标准基准测试上进行训练。鉴于最近在大型语言和视觉模型方面的进展,一个自然问题随之而来:这些模型能否直接在元少样本学习基准测试上表现良好?以 CLIP 等多模态基础模型尤为感兴趣,因为它们学习了联合(图像、文本)嵌入。事实证明,多模态训练能够提高模型的鲁棒性,尤其是在少样本设置中经常观察到的模糊性方面。这项研究表明,结合 CLIP 文本编码器和图像编码器的多模态方法在各种被广泛采用的基准测试上超越了最先进的元少样本学习器,且无需额外训练。我们的结果确认了此类多模态基础模型(如 CLIP)的潜力和鲁棒性,并为现有和未来方法提供了基准。

引用

@article{arxiv.2405.10954,
  title  = {Multimodal CLIP Inference for Meta-Few-Shot Image Classification},
  author = {Constance Ferragu and Philomene Chagniot and Vincent Coyette},
  journal= {arXiv preprint arXiv:2405.10954},
  year   = {2024}
}