中文

面向训练自由的少样本分类的跨模态原型对齐与混合

计算机视觉与模式识别 2026-03-26 v1

摘要

视觉语言模型(VLMs)如 CLIP 被训练用于对齐文本和图像配对。为了提高 CLIP 基于的少样本图像分类性能,近期研究发现,除了文本嵌入,训练集中的图像嵌入也是重要的信息来源。本文研究了直接混合图像和文本原型用于少样本分类的影响,并从偏差-方差视角进行分析。我们表明,混合原型的作用类似于 shrinkage 估计器。虽然混合原型会提高分类性能,但图像原型仍会以特定于实例的背景或上下文信息的形式引入一些噪声。为了捕获仅与给定分类任务相关的图像空间信息,我们提出将图像原型投影到语义文本嵌入空间的主导方向,以获得文本对齐的语义图像子空间。当这些文本对齐的图像原型与文本嵌入混合时,进一步提高了分类性能。然而,对于 CLIP 中跨模态对齐不佳的下游数据集,语义对齐可能并非最优。我们表明,仍可通过建模各类的协方差来利用图像子空间。我们在少样本分类基准测试中演示了,结合文本对齐混合原型分类器和基于 LDA 的图像特定分类器的组合性能优于现有方法。

关键词

引用

@article{arxiv.2603.24528,
  title  = {Cross-Modal Prototype Alignment and Mixing for Training-Free Few-Shot Classification},
  author = {Dipam Goswami and Simone Magistri and Gido M. van de Ven and Bartłomiej Twardowski and Andrew D. Bagdanov and Tinne Tuytelaars and Joost van de Weijer},
  journal= {arXiv preprint arXiv:2603.24528},
  year   = {2026}
}

备注

Preprint