中文

基于文本分解的 CLIP 图像表征解读

计算机视觉与模式识别 2024-04-01 v4 人工智能

摘要

我们通过分析单个模型组件如何影响最终表征来研究 CLIP 图像编码器。我们将图像表征分解为各个图像块、模型层和注意力头上的求和,并利用 CLIP 的文本表征来解释这些求和项。在解读注意力头时,我们通过自动寻找跨越其输出空间的文本表征来刻画每个头的角色,这揭示了许多头具有特定属性相关的角色(例如位置或形状)。接下来,在解读图像块时,我们揭示了 CLIP 中一种涌现的空间定位现象。最后,我们利用这一理解从 CLIP 中移除伪特征,并创建了一个强大的零样本图像分割器。我们的结果表明,对 transformer 模型的可扩展理解是可以实现的,并且可用于修复和改进模型。

关键词

引用

@article{arxiv.2310.05916,
  title  = {Interpreting CLIP's Image Representation via Text-Based Decomposition},
  author = {Yossi Gandelsman and Alexei A. Efros and Jacob Steinhardt},
  journal= {arXiv preprint arXiv:2310.05916},
  year   = {2024}
}

备注

Project page and code: https://yossigandelsman.github.io/clip_decomposition/