中文

超越CLIP:通过文本分解和解释ViT中的图像表示

计算机视觉与模式识别 2024-10-22 v2 机器学习

摘要

最近的工作探索了CLIP-ViT模型的各个组件如何通过利用CLIP的共享图像-文本表示空间对最终表示做出贡献。这些组件,如注意力头和MLP,已被证明能够捕获不同的图像特征,如形状、颜色或纹理。然而,理解这些组件在任意视觉变换器(ViT)中的作用是具有挑战性的。为此,我们引入了一个通用框架,可以识别超越CLIP的ViT中各种组件的作用。具体地,我们(a)自动将最终表示分解为不同模型组件的贡献,以及(b)将这些贡献线性映射到CLIP空间以通过文本进行解释。此外,我们引入了一种新颖的评分函数,根据组件对特定特征的重要性进行排序。将我们的框架应用于各种ViT变体(例如DeiT、DINO、DINOv2、Swin、MaxViT),我们获得了关于不同组件在特定图像特征方面作用的见解。这些见解有助于应用,如使用文本描述或参考图像进行图像检索、可视化令牌重要性热图以及减轻虚假相关性。我们在https://github.com/SriramB-98/vit-decompose发布代码以重现实验。

关键词

引用

@article{arxiv.2406.01583,
  title  = {Decomposing and Interpreting Image Representations via Text in ViTs Beyond CLIP},
  author = {Sriram Balasubramanian and Samyadeep Basu and Soheil Feizi},
  journal= {arXiv preprint arXiv:2406.01583},
  year   = {2024}
}

备注

NeurIPS 2024, 31 pages, 15 figures