局部梯度平滑:针对局部对抗攻击的防御
计算机视觉与模式识别
2018-11-20 v2
摘要
深度神经网络(DNNs)已显示出对对抗攻击的脆弱性,即精心扰动的输入旨在推理时误导网络。最近提出的局部攻击——局部可见对抗噪声(LaVAN)和对抗块(Adversarial patch)——仅在特定区域内添加对抗噪声而不影响图像中的显著对象,给深度学习安全性带来了新挑战。受此类攻击在图像特定位置引入集中的高频变化这一观察驱动,我们开发了一种有效的方法,在梯度域估计噪声位置,并在图像域转换那些由对抗噪声引起的高激活区域,同时对正确分类重要的显著对象影响最小。我们提出的局部梯度平滑(LGS)方案通过在将图像输入 DNN 推理前正则化估计噪声区域内的梯度来实现此目的。我们展示了该方法相对于其他防御方法(包括数字水印、JPEG 压缩、全变分最小化(TVM)和特征压缩)在 ImageNet 数据集上的有效性。此外,我们系统地研究了所提防御机制对反向传播可微近似(BPDA)的鲁棒性,BPDA 是最近为突破通过变换输入样本以最小化对抗效应的防御而开发的尖端攻击。与其他防御机制相比,在局部对抗攻击设定下 LGS 迄今为止对 BPDA 最具抵抗力。
引用
@article{arxiv.1807.01216,
title = {Local Gradients Smoothing: Defense against localized adversarial attacks},
author = {Muzammal Naseer and Salman H. Khan and Fatih Porikli},
journal= {arXiv preprint arXiv:1807.01216},
year = {2018}
}
备注
Accepted At WACV-2019