解释可被操纵且几何性质难辞其咎
机器学习
2019-09-26 v2 密码学与安全
机器学习
摘要
解释方法旨在使神经网络更可信且可解释。在本文中,我们展示了一种对这两个目的而言都令人不安的解释方法性质。具体而言,我们表明,通过对输入施加视觉上几乎不可察觉且使网络输出近似保持不变的扰动,可以任意操纵解释。我们从理论上证明,这一现象可与神经网络的某些几何性质相关联。这使我们能够推导出解释受操纵敏感性的上界。基于该结果,我们提出了增强解释鲁棒性的有效机制。
引用
@article{arxiv.1906.07983,
title = {Explanations can be manipulated and geometry is to blame},
author = {Ann-Kathrin Dombrowski and Maximilian Alber and Christopher J. Anders and Marcel Ackermann and Klaus-Robert Müller and Pan Kessel},
journal= {arXiv preprint arXiv:1906.07983},
year = {2019}
}