通过随机离散化防御白盒对抗攻击
机器学习
2019-03-27 v1 密码学与安全
机器学习
摘要
对抗扰动会显著降低最先进图像分类器的准确率。在本文中,我们提出并分析了一种简单且计算高效的防御策略:注入随机高斯噪声,对每个像素进行离散化,然后将结果输入任意预训练分类器。理论上,我们证明我们的随机离散化策略降低了原始输入与对抗输入之间的 KL 散度,从而给出了任意分类器针对任意(可能是白盒的) 有界对抗攻击的分类准确率下界。在实验上,我们在由强迭代 PGD 攻击生成的对抗样本上评估我们的防御。在 ImageNet 上,我们的防御比对抗训练网络以及 NIPS 2017 对抗攻击与防御竞赛的获胜防御更为鲁棒。
引用
@article{arxiv.1903.10586,
title = {Defending against Whitebox Adversarial Attacks via Randomized Discretization},
author = {Yuchen Zhang and Percy Liang},
journal= {arXiv preprint arXiv:1903.10586},
year = {2019}
}
备注
In proceedings of the 22nd International Conference on Artificial Intelligence and Statistics