中文

从相互知识视角解读与分析 CLIP 的零样题图像分类

计算机视觉与模式识别 2024-12-19 v3

摘要

对比式语言-图像预训练(CLIP)通过将图像和文本类别表示映射到共享嵌入空间,然后检索距离图像最近的类别,实现零样题图像分类。本工作从两种模态编码器在共同学习中学习到的概念,即何种概念影响联合嵌入空间中点彼此靠近或远离,入手,提出一种新颖的 CLIP 模型解释方法。具体而言,我们提出基于文本概念的解释方法,展示其有效性,并对包含 13 个不同架构、规模和预训练数据集的 CLIP 模型进行分析。我们围绕相互知识探讨不同方面,并分析零题预测。我们的做法展示了一种有效且易于人类理解的 CLIP 零题分类决策方式。

关键词

引用

@article{arxiv.2410.13016,
  title  = {Interpreting and Analysing CLIP's Zero-Shot Image Classification via Mutual Knowledge},
  author = {Fawaz Sammani and Nikos Deligiannis},
  journal= {arXiv preprint arXiv:2410.13016},
  year   = {2024}
}

备注

Accepted to NeurIPS 2024