EMAP:基于最小对抗扰动的解释方法
机器学习
2019-12-03 v1 机器学习
摘要
现代基于实例的模型无关解释方法(LIME、SHAP、L2X)在重数据工业中广泛用于模型诊断和终端用户解释。这些方法通常返回输入特征的权重或子集作为某实例分类的解释。另一文献则认为反事实实例能更好地刻画黑盒分类器的决策。我们提出 EMAP,一种基于神经网络的方法,其将引起底层黑盒模型误分类所需的最小对抗扰动作为解释返回。我们表明该方法融合了两种范式,在连续特征空间中恢复特征加权方法的输出,同时指示最近反事实实例所在的方向。我们的方法还对其自身解释提供隐式置信度估计,增添了其他模型诊断方法所缺乏的清晰性。此外,EMAP 在速度上比较基于采样的方法(如 LIME)提升一个数量级,可在时间关键型应用中或数据集层级(基于采样的方法不可行处)提供模型解释。我们使用分区 Gumbel 层将方法扩展至类别特征,并在若干标准数据集上展示其有效性。
引用
@article{arxiv.1912.00872,
title = {EMAP: Explanation by Minimal Adversarial Perturbation},
author = {Matt Chapman-Rounds and Marc-Andre Schulz and Erik Pazos and Konstantinos Georgatzis},
journal= {arXiv preprint arXiv:1912.00872},
year = {2019}
}
备注
9 pages, 4 figures, 1 table