两全其美:基于人类可理解概念的局部与全局解释
机器学习
2022-02-01 v2
摘要
可解释性技术旨在提供模型决策背后的依据,通常通过对单个预测的解释(局部解释,例如“为何该患者被诊断为该疾病”)或对一类预测的解释(全局解释,例如“为何该组患者总体上被诊断为该疾病”)来实现。虽然许多方法专注于其中之一,但很少有框架能以一致的方式同时提供局部与全局解释。在这项工作中,我们结合了两种强大的现有技术,一种局部的(积分梯度,IG)与一种全局的(使用概念激活向量进行测试,TCAV),以提供基于概念的局部与全局解释。我们首先使用两个具有已知真实情况的合成数据集对想法进行合理性检验,并进一步用基准自然图像数据集进行演示。我们用各种概念、目标类别、模型架构与IG参数(例如基线)测试了我们的方法。我们表明,与真实情况相比,我们的方法在全局解释上优于原始TCAV,并提供有用的局部见解。最后,一项用户研究证明了该方法相较于无解释或仅有全局解释的实用性。我们希望我们的工作能为在众多现有局部与全局方法之间搭建桥梁、从而两全其美迈出一步。
引用
@article{arxiv.2106.08641,
title = {Best of both worlds: local and global explanations with human-understandable concepts},
author = {Jessica Schrouff and Sebastien Baur and Shaobo Hou and Diana Mincu and Eric Loreaux and Ralph Blanes and James Wexler and Alan Karthikesalingam and Been Kim},
journal= {arXiv preprint arXiv:2106.08641},
year = {2022}
}