中文

尊重模型:基于共享比分解的细粒度鲁棒解释

计算机视觉与模式识别 2024-12-13 v2 人工智能

摘要

现有解释方法在真实阐明底层模型决策过程方面的真实性已受到质疑。现有方法已偏离了对模型的忠实表示,因此易受对抗攻击。为解决此问题,我们提出一种新颖的可解释人工智能(eXplainable AI, XAI)方法,称为SRD(Sharing Ratio Decomposition,共享比分解),该方法真诚地反映模型的推理过程,从而显著增强了我们解释的鲁棒性。与传统的神经元层面关注点不同,我们采用向量视角来考虑滤波器之间复杂的非线性交互。我们还引入了一个有趣的观察,称为仅激活模式预测(Activation-Pattern-Only Prediction, APOP),这让我们强调非活跃神经元的重要性,并重新定义相关性,使其包含所有相关信息,包括活跃和非活跃神经元。我们的方法SRD允许对逐点特征向量(Pointwise Feature Vector, PFV)进行递归分解,在任何层提供高分辨率的有效感受野(Effective Receptive Field, ERF)。

关键词

引用

@article{arxiv.2402.03348,
  title  = {Respect the model: Fine-grained and Robust Explanation with Sharing Ratio Decomposition},
  author = {Sangyu Han and Yearim Kim and Nojun Kwak},
  journal= {arXiv preprint arXiv:2402.03348},
  year   = {2024}
}

备注

To be published in ICLR 2024