GANMEX:由基于 GAN 的反事实解释基线引导的一对一归因
机器学习
2021-06-24 v4
摘要
归因方法已被证明是识别导致学习模型预测的关键特征的有前景方法。尽管大多数现有归因方法依赖基线输入进行特征扰动,但针对基线选择问题的研究有限。基线的不当选择限制了多类分类器的一对一(1-vs-1)解释能力,即归因方法无法解释为何某输入属于其原始类别而非另一指定目标类别。当某些类别彼此比其它类别更相似时(例如多种动物中的两类鸟),1-vs-1 解释至关重要,因其聚焦于关键区分特征而非跨类共享特征。本文中,我们提出基于生成对抗网络(GAN)的模型可解释性(GANMEX),一种将待解释分类器作为对抗网络一部分嵌入的生成对抗网络(GAN)新方法。我们的方法有效地将反事实基线选为属于目标类别的最接近真实样本,使归因方法能提供真正的 1-vs-1 解释。我们表明 GANMEX 基线改善了显著图,并在基于扰动的评估指标上较现有基线取得更强性能。现有归因结果以对模型随机化不敏感而著称,我们证明 GANMEX 基线在模型级联随机化下带来更好结果。
引用
@article{arxiv.2011.06015,
title = {GANMEX: One-vs-One Attributions Guided by GAN-based Counterfactual Explanation Baselines},
author = {Sheng-Min Shih and Pin-Ju Tien and Zohar Karnin},
journal= {arXiv preprint arXiv:2011.06015},
year = {2021}
}
备注
International Conference on Machine Learning 2021