中文

通过激活掩码进行因果归因

计算机视觉与模式识别 2026-05-19 v2

摘要

面向 Vision Transformer(ViT)的归因方法旨在识别影响模型预测的图像区域,但产生准确且局部化的归因仍然具有挑战性。现有的归因方法面临多个局限性:梯度基方法、相关性传播方法和注意力基方法依赖局部近似,而扰动或优化基方法则干预输入、token 或替代模型,而非内部 patch 表示。关键挑战在于,类相关证据通过跨层的 patch token 之间的相互作用形成;仅 operate on input changes、attention weights 或 backward relevance signals 的方法可能因此提供对 patch 重要性的间接代理,而非直接测试上下文化 patch 表示的预测效应。我们提出了通过激活掩码进行因果归因(Causal Attribution via Activation Patching, CAAP),其通过直接干预内部激活来估计单个图像 patch 对 ViT 预测的贡献,而非使用学习的掩码或合成扰动模式。对于每个 patch,CAAP 将对应的 source-image 激活插入到中性 target context 中,覆盖多个中间层范围,并使用 resulting target-class score 作为归因信号。 resulting attribution map 反映了 patch 关联内部表示对模型预测的因果贡献。这种因果干预通过捕获初始表征形成后的语义证据,同时避免后期层的全局混合,从而降低空间特异性。 在多个 ViT 骨干网络和标准指标上,CAAP 在各种设置下均一致优于现有方法,产生更加忠实且局部化的归因。

关键词

引用

@article{arxiv.2603.13652,
  title  = {Causal Attribution via Activation Patching},
  author = {Amirmohammad Izadi and Mohammadali Banayeeanzade and Alireza Mirrokni and Hosein Hasani and Mobin Bagherian and Faridoun Mehri and Mahdieh Soleymani Baghshah},
  journal= {arXiv preprint arXiv:2603.13652},
  year   = {2026}
}