NoiseCAM:面向噪声与对抗攻击边界的可解释AI
机器学习
2023-03-14 v1 人工智能
摘要
深度学习(DL)与深度神经网络(DNNs)被广泛应用于各个领域。然而,对抗攻击可以轻易误导神经网络并导致错误决策。在安全关键应用中,防御机制备受青睐。在本文中,首先,我们使用梯度类激活映射(GradCAM)来分析当VGG-16网络的输入混合对抗扰动或高斯噪声时其行为偏差。特别地,我们的方法能够定位对对抗扰动和高斯噪声敏感的脆弱层。我们还表明,脆弱层的行为偏差可用于检测对抗样本。其次,我们提出一种新颖的NoiseCAM算法,该算法整合来自全局和像素级加权类激活映射的信息。我们的算法对对抗扰动敏感,且不会对输入中混合的高斯随机噪声产生响应。第三,我们比较了使用行为偏差和NoiseCAM检测对抗样本,并表明NoiseCAM在整体性能上优于行为偏差建模。我们的工作可提供一个有用的工具来防御深度神经网络上的某些对抗攻击。
引用
@article{arxiv.2303.06151,
title = {NoiseCAM: Explainable AI for the Boundary Between Noise and Adversarial Attacks},
author = {Wenkai Tan and Justus Renkhoff and Alvaro Velasquez and Ziyu Wang and Lusi Li and Jian Wang and Shuteng Niu and Fan Yang and Yongxin Liu and Houbing Song},
journal= {arXiv preprint arXiv:2303.06151},
year = {2023}
}
备注
Submitted to IEEE Fuzzy 2023. arXiv admin note: text overlap with arXiv:2303.06032