从权重到概念:通过奇异向量分解实现 CLIP 的数据自由可解释性
计算机视觉与模式识别
2026-03-27 v1
摘要
随着视觉语言模型在大规模部署中,其内部机制的理解变得越来越关键。现有的可解释性方法主要依赖激活值,使其数据依赖、易受数据偏见影响,常受限于粗糙的层级解释。我们引入 SITH(Semantic Inspection of Transformer Heads,Transformer 头语义检查),一个完全数据自由、训练自由的框架,直接分析 CLIP 的视觉 Transformer 在权重空间。对于每个注意力头,我们将其值-输出矩阵分解为奇异向量,并通过 COMP(Coherent Orthogonal Matching Pursuit,一致正交匹配追踪)算法对其进行解释,将其解释为人类可解释概念的稀疏、一致组合。我们表明 SITH 能产生连贯、忠实的层内解释,通过复原忠诚度和可解释性实验进行验证。这使我们能够使用 SITH 对权重空间进行精确、可解释的模型编辑,以放大或抑制特定概念,无需重新训练即可提升下游性能。此外,我们使用 SITH 研究模型适应性,表明微调主要是对稳定语义基底进行重新加权,而不是学习全新的特征。
关键词
引用
@article{arxiv.2603.24653,
title = {From Weights to Concepts: Data-Free Interpretability of CLIP via Singular Vector Decomposition},
author = {Francesco Gentile and Nicola Dall'Asen and Francesco Tonini and Massimiliano Mancini and Lorenzo Vaquero and Elisa Ricci},
journal= {arXiv preprint arXiv:2603.24653},
year = {2026}
}
备注
Accepted @ CVPR 2026. Project page: https://frangente.github.io/SITH/