深度视觉特征神经元解释的污染攻击
机器学习
2023-10-26 v1
摘要
深度神经网络(DNN)无法解释其黑盒行为,导致近期可解释性方法激增。然而,人们越来越担心这些可解释性方法不够鲁棒和可信。在这项工作中,我们在统一流程下对神经元解释方法进行了首次鲁棒性分析,并表明这些解释会被添加到探测数据中的随机噪声和精心设计的扰动显著污染。我们发现,即使添加标准差为 0.02 的小随机噪声,也足以改变更深层中多达 28% 神经元所分配的概念。此外,我们设计了一种新颖的污染算法,并表明我们的算法可以通过投毒少于 10% 的探测数据来操纵超过 80% 神经元的解释。这引发了在现实安全和公平性关键应用中信任神经元解释方法的担忧。
引用
@article{arxiv.2310.16332,
title = {Corrupting Neuron Explanations of Deep Visual Features},
author = {Divyansh Srivastava and Tuomas Oikarinen and Tsui-Wei Weng},
journal= {arXiv preprint arXiv:2310.16332},
year = {2023}
}