基于随机消融的稀疏对抗攻击鲁棒性证书
机器学习
2019-11-22 v1 机器学习
摘要
近来,通过使用随机平滑技术,已开发出可证明保证分类器对受限 L_1 和 L_2 量级对抗扰动的鲁棒性的方法:鲁棒分类是在加性噪声随机扰动样本上基分类的共识。在本文中,我们将该技术扩展到 L_0 威胁模型。我们提出了一种高效且可证明鲁棒的防御方法,通过对输入特征进行随机消融而非使用加性噪声,来抵御稀疏对抗攻击。在实验上,在 MNIST 上,我们可以证明超过 50% 的图像分类对至多 8 个像素的任何失真具有鲁棒性。这与未受保护分类器在 MNIST 上对现代 L_0 攻击的观测经验鲁棒性相当,证明了所提鲁棒性证书的紧性。我们还在 ImageNet 和 CIFAR-10 上评估了我们的证书。我们的证书相对于同期工作(Lee et al. 2019)提供的证书有所改进,后者使用随机噪声而非消融(在 MNIST 上中位数证书为 8 像素对比 4 像素;在 ImageNet 上为 16 像素对比 1 像素)。此外,我们经验性地证明我们的分类器对 MNIST 上的现代稀疏对抗攻击高度鲁棒。我们的分类在中位数上对多达 31 像素的对抗扰动具有鲁棒性,而最先进防御方法报道为 22 像素,代价是分类精度轻微下降(约 2.3%)。代码可在 https://github.com/alevine0/randomizedAblation/ 获取。
引用
@article{arxiv.1911.09272,
title = {Robustness Certificates for Sparse Adversarial Attacks by Randomized Ablation},
author = {Alexander Levine and Soheil Feizi},
journal= {arXiv preprint arXiv:1911.09272},
year = {2019}
}