从相互知识视角解读与分析 CLIP 的零样题图像分类
计算机视觉与模式识别
2024-12-19 v3
摘要
对比式语言-图像预训练(CLIP)通过将图像和文本类别表示映射到共享嵌入空间,然后检索距离图像最近的类别,实现零样题图像分类。本工作从两种模态编码器在共同学习中学习到的概念,即何种概念影响联合嵌入空间中点彼此靠近或远离,入手,提出一种新颖的 CLIP 模型解释方法。具体而言,我们提出基于文本概念的解释方法,展示其有效性,并对包含 13 个不同架构、规模和预训练数据集的 CLIP 模型进行分析。我们围绕相互知识探讨不同方面,并分析零题预测。我们的做法展示了一种有效且易于人类理解的 CLIP 零题分类决策方式。
引用
@article{arxiv.2410.13016,
title = {Interpreting and Analysing CLIP's Zero-Shot Image Classification via Mutual Knowledge},
author = {Fawaz Sammani and Nikos Deligiannis},
journal= {arXiv preprint arXiv:2410.13016},
year = {2024}
}
备注
Accepted to NeurIPS 2024