利用流形外洗涤剂的解释洗白
机器学习
2020-07-21 v1 机器学习
摘要
解释方法有望使黑盒分类器更加透明。因此,人们希望它们能够作为算法明智、公平且可信的决策过程的证明,从而提高最终用户对算法的接受度。在本文中,我们从理论和实验两方面表明,这些希望目前是没有根据的。具体而言,我们证明对于任意分类器 ,总可以构造另一个分类器 ,其在数据上行为相同(相同的训练、验证和测试误差)但具有被任意操纵的解释图。我们利用微分几何从理论上推导了这一结论,并在多种解释方法、网络架构和数据集上进行了实验验证。受我们理论见解的启发,我们随后提出了一种对现有解释方法的改进,使其显著更加鲁棒。
引用
@article{arxiv.2007.09969,
title = {Fairwashing Explanations with Off-Manifold Detergent},
author = {Christopher J. Anders and Plamen Pasliev and Ann-Kathrin Dombrowski and Klaus-Robert Müller and Pan Kessel},
journal= {arXiv preprint arXiv:2007.09969},
year = {2020}
}
备注
22 pages with 43 figures, to be published in ICML2020