分解模型:基于广义积分梯度(GIG)的图像模型机制可解释性
计算机视觉与模式识别
2024-09-04 v1 人工智能
摘要
在语言模型的“可解释人工智能”(XAI)领域,从对单个决策的局部解释发展到对高层概念的全局解释,为机制可解释性奠定了基础,其目标是解码模型的确切运算过程。然而,这一范式在图像模型中尚未得到充分探索,现有的方法主要侧重于类别特定的解释。本文提出了一种新方法,系统地追踪从输入经过整个网络到最终输出的完整路径。我们利用逐点特征向量(PFV)和有效感受野(ERF)将模型嵌入分解为可解释的概念向量。然后,我们使用提出的广义积分梯度(GIG)方法计算概念向量之间的相关性,从而实现对模型行为的全数据集、全面分析。我们在概念提取和概念相关性归因两方面,通过定性和定量评估验证了我们的方法。我们的方法增进了对图像模型语义重要性的理解,并为其运行机制提供了整体视角。
关键词
引用
@article{arxiv.2409.01610,
title = {Decompose the model: Mechanistic interpretability in image models with Generalized Integrated Gradients (GIG)},
author = {Yearim Kim and Sangyu Han and Sangbum Han and Nojun Kwak},
journal= {arXiv preprint arXiv:2409.01610},
year = {2024}
}