针对神经元激活最大化解释的对抗攻击
机器学习
2023-06-14 v1 计算机视觉与模式识别
摘要
训练好的深度神经网络的内部功能行为素来难以解释。激活最大化方法是一类用于解释和分析训练后深度学习模型的技术。其内容为寻找能最大激活给定神经元或特征图的输入。这些输入可从数据集中选取或通过优化获得。然而,可解释性方法可能受到欺骗。本工作中,我们考虑 adversary(对抗者)为欺骗解释而操纵模型的概念。我们提出一种执行该操纵的优化框架,并展示了与 CNN 相关的流行激活最大化解释技术可被操纵以改变解释的若干方式,从而揭示这些方法的可靠性。
引用
@article{arxiv.2306.07397,
title = {Adversarial Attacks on the Interpretation of Neuron Activation Maximization},
author = {Geraldin Nanfack and Alexander Fulleringer and Jonathan Marty and Michael Eickenberg and Eugene Belilovsky},
journal= {arXiv preprint arXiv:2306.07397},
year = {2023}
}