提升白盒对抗攻击中的梯度
机器学习
2020-10-22 v1 密码学与安全
计算机视觉与模式识别
摘要
深度神经网络(DNN)在图像分类与目标识别等多种人工智能应用中发挥着关键作用。然而,越来越多研究表明 DNN 中存在对抗样本,其与原始样本几乎不可感知地不同,却可大幅改变网络输出。现有白盒攻击算法能生成强大的对抗样本。尽管如此,多数算法集中于如何迭代地最佳利用梯度以提升对抗性能。相反,本文关注广泛使用的 ReLU 激活函数的性质,发现存在两种现象(即错误阻塞与过度传输)在反向传播中误导 ReLU 梯度的计算。这两个问题均放大了由梯度预测的损失函数变化与相应实际变化之间的差异,并误导梯度从而导致更大的扰动。因此,我们提出一种通用对抗样本生成方法,称为 ADV-ReLU,以增强基于梯度的白盒攻击算法的性能。在网络反向传播过程中,我们的方法计算损失函数相对于网络输入的梯度,将数值映射为分数,并选取其中一部分来更新被误导的梯度。在 ImageNet 上的综合实验结果表明,我们的 ADV-ReLU 可轻松集成到许多最先进的基于梯度的白盒攻击算法中,并可迁移至黑盒攻击方法,以进一步减小 范数下的扰动。
引用
@article{arxiv.2010.10712,
title = {Boosting Gradient for White-Box Adversarial Attacks},
author = {Hongying Liu and Zhenyu Zhou and Fanhua Shang and Xiaoyu Qi and Yuanyuan Liu and Licheng Jiao},
journal= {arXiv preprint arXiv:2010.10712},
year = {2020}
}
备注
9 pages,6 figures