中文

Transductive Zero-Shot和Few-Shot CLIP

计算机视觉与模式识别 2024-05-30 v1 人工智能

摘要

在few-shot图像分类中,transductive推理已被广泛研究,但在最近快速发展的视觉语言模型如CLIP的文献中被完全忽视了。本文 addresses transductive zero-shot和few-shot CLIP分类挑战,其中推理是在未标记查询样本的mini-batch上联合进行的,而不是对每个实例独立处理。我们最初构建信息丰富的视觉-文本概率特征,导致单位单形集上的分类问题。受期望最大化(EM)启发,我们的基于优化的分类目标使用Dirichlet分布为每个类别建模数据概率分布。随后以一种新的块式Majorization-Minimization算法求解该最小化问题,同时估计分布参数和类别分配。对11个数据集进行的大量数值实验凸显了该批处理推理方法的优势和有效性。在测试batch为75个样本的zero-shot任务中,我们的方法相较于CLIP的zero-shot性能实现了近20%的ImageNet准确率提升。此外,我们在few-shot设置下超越了最先进的方法。代码可在 https://github.com/SegoleneMartin/transductive-CLIP 获取。

关键词

引用

@article{arxiv.2405.18437,
  title  = {Transductive Zero-Shot and Few-Shot CLIP},
  author = {Ségolène Martin and Yunshi Huang and Fereshteh Shakeri and Jean-Christophe Pesquet and Ismail Ben Ayed},
  journal= {arXiv preprint arXiv:2405.18437},
  year   = {2024}
}

备注

2024 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), Jun 2024, Seattle (USA), Washington, United States