中文

探索神经网络上的对抗攻击:一种可解释的方法

机器学习 2023-03-13 v1 密码学与安全 计算机视觉与模式识别 图像与视频处理

摘要

深度学习(DL)正被应用于多个领域,尤其是自动驾驶等安全关键应用。因此,确保这些方法的鲁棒性以抵消对抗攻击引起的不确定行为具有重要意义。本文中,我们使用梯度热图分析 VGG-16 模型在输入图像混入对抗噪声与统计上相似的高斯随机噪声时的响应特征。特别地,我们逐层比较网络响应以确定错误发生位置。得出了若干有趣发现。首先,与高斯随机噪声相比,有意生成的对抗噪声通过分散网络的集中区域引起严重的行为偏差。其次,在许多情况下,对抗样本只需破坏少数中间块即可误导最终决策。第三,我们的实验揭示特定块更易受攻击且更易被对抗样本利用。最后,我们证明 VGG-16 模型的 Block4_conv1Block4\_conv1Block5_cov1Block5\_cov1 层更易受对抗攻击。我们的工作可为开发更可靠的深度神经网络(DNN)模型提供有价值的见解。

关键词

引用

@article{arxiv.2303.06032,
  title  = {Exploring Adversarial Attacks on Neural Networks: An Explainable Approach},
  author = {Justus Renkhoff and Wenkai Tan and Alvaro Velasquez and illiam Yichen Wang and Yongxin Liu and Jian Wang and Shuteng Niu and Lejla Begic Fazlic and Guido Dartmann and Houbing Song},
  journal= {arXiv preprint arXiv:2303.06032},
  year   = {2023}
}