基于反事实的判别性归因
机器学习
2021-09-29 v1 计算机视觉与模式识别
摘要
我们提出一种神经网络可解释性方法,通过将特征归因与反事实解释相结合,生成突出类对之间最具判别性特征的特征归因图。我们展示了该方法可用于以客观方式定量评估特征归因方法的性能,从而防止潜在的观察者偏差。我们在三个不同的数据集上评估了所提方法,包括一个具有挑战性的人工数据集和真实的生物数据。我们从定量和定性上表明,所突出特征比使用常规归因方法提取的特征具有显著更高的判别性,并论证此类解释更适用于理解深度神经网络所学习的细粒度类间差异。
引用
@article{arxiv.2109.13412,
title = {Discriminative Attribution from Counterfactuals},
author = {Nils Eckstein and Alexander S. Bates and Gregory S. X. E. Jefferis and Jan Funke},
journal= {arXiv preprint arXiv:2109.13412},
year = {2021}
}