中文

GLANCE:用于基于架构无关概念的全局到局部解释

计算机视觉与模式识别 2022-07-06 v1 人工智能

摘要

当前大多数可解释性技术侧重于捕捉输入空间中特征的重要性。然而,鉴于模型与数据生成过程的复杂性,所得解释远非“完整”,因为它们缺乏特征交互的提示及其“效应”的可视化。在本工作中,我们提出一种新颖的双生代理可解释性框架,以解释任何基于 CNN 的图像分类器(无论其架构如何)所做的决策。为此,我们首先从分类器中解耦潜特征,随后将这些特征与观测到/人类定义的“上下文”特征对齐。这些对齐的特征形成了语义上有意义的概念,用于提取描绘“感知到”的数据生成过程的因果图,描述未观测潜特征与观测“上下文”特征之间的特征内与特征间交互。该因果图作为一个全局模型,从中可提取不同形式的局部解释。具体而言,我们提供一个生成器以可视化潜空间中特征间交互的“效应”,并从中得出特征重要性作为局部解释。我们的框架利用对抗知识蒸馏忠实学习分类器潜空间的表示,并将其用于提取视觉解释。我们使用带有额外正则化项以强制解耦与对齐的 styleGAN-v2 架构。我们在 Morpho-MNIST 与 FFHQ 人脸数据集上展示并评估了由我们框架获得的解释。我们的框架可在 \url{https://github.com/koriavinash1/GLANCE-Explanations} 获取。

关键词

引用

@article{arxiv.2207.01917,
  title  = {GLANCE: Global to Local Architecture-Neutral Concept-based Explanations},
  author = {Avinash Kori and Ben Glocker and Francesca Toni},
  journal= {arXiv preprint arXiv:2207.01917},
  year   = {2022}
}