中文

利用流形外洗涤剂的解释洗白

机器学习 2020-07-21 v1 机器学习

摘要

解释方法有望使黑盒分类器更加透明。因此,人们希望它们能够作为算法明智、公平且可信的决策过程的证明,从而提高最终用户对算法的接受度。在本文中,我们从理论和实验两方面表明,这些希望目前是没有根据的。具体而言,我们证明对于任意分类器 gg,总可以构造另一个分类器 g~\tilde{g},其在数据上行为相同(相同的训练、验证和测试误差)但具有被任意操纵的解释图。我们利用微分几何从理论上推导了这一结论,并在多种解释方法、网络架构和数据集上进行了实验验证。受我们理论见解的启发,我们随后提出了一种对现有解释方法的改进,使其显著更加鲁棒。

关键词

引用

@article{arxiv.2007.09969,
  title  = {Fairwashing Explanations with Off-Manifold Detergent},
  author = {Christopher J. Anders and Plamen Pasliev and Ann-Kathrin Dombrowski and Klaus-Robert Müller and Pan Kessel},
  journal= {arXiv preprint arXiv:2007.09969},
  year   = {2020}
}

备注

22 pages with 43 figures, to be published in ICML2020