从归因图到人类可理解的解释:基于概念相关性传播
机器学习
2024-01-09 v2 人工智能
摘要
可解释人工智能(XAI)领域旨在为当今强大但不透明的深度学习模型带来透明度。局部 XAI 方法以归因图形式解释单个预测,从而识别重要特征出现的位置(但不提供其代表什么的信息),而全局解释技术可视化模型总体上学到编码的概念。这两类方法因此仅提供部分洞察,并将解释模型推理的负担留给用户。本工作中我们引入概念相关性传播(CRP)方法,其结合局部与全局视角,从而能对单个预测回答“在哪里”和“是什么”的问题。我们在多种设定下展示方法能力,表明 CRP 带来更具人类可解释性的解释,并通过概念图集、概念组合分析以及对概念子空间及其在细粒度决策中作用的定量研究,提供对模型表征与推理的深入洞察。
引用
@article{arxiv.2206.03208,
title = {From Attribution Maps to Human-Understandable Explanations through Concept Relevance Propagation},
author = {Reduan Achtibat and Maximilian Dreyer and Ilona Eisenbraun and Sebastian Bosse and Thomas Wiegand and Wojciech Samek and Sebastian Lapuschkin},
journal= {arXiv preprint arXiv:2206.03208},
year = {2024}
}
备注
87 pages (13 pages manuscript, 8 pages references, 66 pages appendix) 63 figures (6 in manuscript, 57 in appendix) 3 tables (in appendix)