从“是什么”到“怎么做”:归因 CLIP 潜在组件揭示意外的语义依赖
机器学习
2025-05-27 v1 人工智能
摘要
基于 Transformer 的 CLIP 模型被广泛用于文本-图像探测和特征提取,因此理解其预测背后的内部机制具有重要意义。虽然近期工作表明稀疏自编码器能产生可解释的潜在组件,但它们关注的是这些组件编码了什么,而忽略了它们如何驱动预测。我们引入了一个可扩展的框架,揭示了潜在组件为何被激活、它们如何与预期语义对齐,以及它们对预测的重要性。为此,我们将归因修补方法应用于 CLIP 中的逐实例组件归因,并强调了广泛使用的 Logit Lens 技术的关键忠实性局限。通过将归因与语义对齐分数相结合,我们能够自动揭示模型对编码了语义上意外或虚假概念的组件的依赖。应用于多个 CLIP 变体后,我们的方法发现了数百个与多义词、复合名词、视觉排版和数据集伪影相关的惊人组件。尽管文本嵌入仍易受语义歧义影响,但与在图像嵌入上训练的线性分类器相比,它们对虚假相关性更具鲁棒性。关于皮肤病变检测的案例研究突显了此类分类器如何放大隐藏的捷径,强调了整体机制可解释性的必要性。我们在 https://github.com/maxdreyer/attributing-clip 提供了代码。
引用
@article{arxiv.2505.20229,
title = {From What to How: Attributing CLIP's Latent Components Reveals Unexpected Semantic Reliance},
author = {Maximilian Dreyer and Lorenz Hufe and Jim Berend and Thomas Wiegand and Sebastian Lapuschkin and Wojciech Samek},
journal= {arXiv preprint arXiv:2505.20229},
year = {2025}
}
备注
25 pages (10 pages manuscript, 4 pages references, 11 pages appendix)