面向补丁攻击可证明防御的(去)随机化平滑
机器学习
2021-01-11 v3 计算机视觉与模式识别
机器学习
摘要
图像上的补丁对抗攻击,即攻击者可在有界大小区域内扭曲像素,是一种重要的威胁模型,因为它为物理对抗攻击提供了定量模型。本文中,我们引入一种针对补丁攻击的可证明防御,它对于给定的图像和补丁攻击尺寸,保证不存在补丁对抗样本。我们的方法关联到提供高置信度概率鲁棒性证书的广泛随机化平滑鲁棒性方案类。通过利用补丁攻击比一般稀疏攻击约束更强这一事实,我们推导出针对它们有意义的较大鲁棒性证书。此外,与基于平滑的针对L_p和稀疏攻击的防御不同,我们针对补丁攻击的防御方法是去随机化的,产生改进的确定性证书。与Chiang等人(2020)提出的依赖区间边界传播的现有补丁认证方法相比,我们的方法训练显著更快,在CIFAR-10上达到高干净与认证鲁棒精度,并在ImageNet规模上提供证书。例如,对于CIFAR-10上的5×5补丁攻击,我们的方法达到高达约57.6%的认证精度(分类器干净精度约83.8%),而现有方法最多30.3%认证精度(分类器干净精度约47.8%)。我们的结果有效地建立了CIFAR-10和ImageNet上补丁攻击可证明防御的新SOTA。代码见https://github.com/alevine0/patchSmoothing。
引用
@article{arxiv.2002.10733,
title = {(De)Randomized Smoothing for Certifiable Defense against Patch Attacks},
author = {Alexander Levine and Soheil Feizi},
journal= {arXiv preprint arXiv:2002.10733},
year = {2021}
}
备注
NeurIPS 2020