中文

解读 CLIP 中神经元的二阶效应

计算机视觉与模式识别 2025-02-14 v3

摘要

我们通过自动生成文本来解释 CLIP 中 individual 神经元的功能。分析直接效应(即从神经元通过残差流到输出的影响)或间接效应(整体贡献)无法捕捉 CLIP 中神经元的功能。因此,我们提出了“二阶镜头”,分析神经元通过后续注意力头流向输出的效应。我们发现,这些效应高度选择性:对于每个神经元,效应仅在 <2% 的图像中显著。此外,每个效应都可以用 CLIP 文本-图像空间中的单个方向来近似表示。我们通过分解这些方向为稀疏的文本表示集合来描述神经元。这些集合揭示了多义行为——每个神经元对应多个常不相关的概念(例如舰船和汽车)。利用这种神经元多义性,我们通过生成与错误类别谬误相关的概念图像来大规模生产“语义”对抗样本。此外,我们使用二阶效应进行零样本分割,超越了以前的方法。我们的结果表明,自动神经元解释可用于模型欺骗以及引入新的模型能力。

关键词

引用

@article{arxiv.2406.04341,
  title  = {Interpreting the Second-Order Effects of Neurons in CLIP},
  author = {Yossi Gandelsman and Alexei A. Efros and Jacob Steinhardt},
  journal= {arXiv preprint arXiv:2406.04341},
  year   = {2025}
}

备注

project page: https://yossigandelsman.github.io/clip_neurons/index.html