基于 ResNet 的 CLIP 解释:神经元-注意力分解
计算机视觉与模式识别
2025-12-02 v3 人工智能
摘要
我们提出了一种新颖的技术,用于解释 CLIP-ResNet 中的神经元,方法是将其对输出贡献分解为单个计算路径。具体而言,我们分析了所有神经元的两两组合以及 CLIP 注意力池化层的后续注意力头。我们发现,这些神经元-头对可以用 CLIP-ResNet 图像-文本嵌入空间中的单个方向来近似表示。凭借这一洞见,我们通过将其与文本关联来解释每个神经元-头对。此外,我们发现只有稀疏的神经元-头对对输出值有显著贡献,并且某些神经元-头对虽然具有多义性,却代表了其对应神经元的子概念。我们利用这些观察结果进行两个应用。首先,我们使用这些配对进行无训练语义分割,超越了 CLIP-ResNet 之前的方法。其次,我们利用神经元-头对的贡献来监控数据分布偏移。我们的结果表明,检查神经网络中单个计算路径可揭示可解释的单元,并且这些单元可用于下游任务。
关键词
引用
@article{arxiv.2509.19943,
title = {Interpreting ResNet-based CLIP via Neuron-Attention Decomposition},
author = {Edmund Bu and Yossi Gandelsman},
journal= {arXiv preprint arXiv:2509.19943},
year = {2025}
}
备注
Accepted at NeurIPS 2025 Workshop on Mechanistic Interpretability. Project page: https://edmundbu.github.io/clip-neur-attn/