Wasserstein 平滑:针对 Wasserstein 对抗攻击的认证鲁棒性
机器学习
2019-10-25 v1 机器学习
摘要
在过去几年中,针对图像分类问题已提出若干基于不同威胁模型的对抗攻击方法。大多数现有防御考虑加性威胁模型,其中样本扰动具有有界的 L_p 范数。然而,这些防御在非加性威胁模型下的对抗攻击中可能脆弱。基于非加性威胁模型的攻击方法一例是 Wong 等人(2019)提出的 Wasserstein 对抗攻击,其中图像与其对抗样本之间的距离由它们归一化像素强度之间的 Wasserstein 度量(“推土机距离”)决定。迄今尚无针对此类攻击的可认证防御。本工作中,我们提出首个利用随机平滑针对 Wasserstein 对抗攻击具有认证鲁棒性的防御。我们通过考虑图像间可能流的空间,并将该空间表示使得图像间 Wasserstein 距离由此流空间中的 L_1 距离上界限定,从而发展出该证书。我们随后可应用现有的 L_1 度量随机平滑证书。在 MNIST 与 CIFAR-10 数据集上,我们发现我们提出的防御在实践中也有效,相较于未保护模型在 Wasserstein 对抗攻击下展现出显著改进的准确率。
引用
@article{arxiv.1910.10783,
title = {Wasserstein Smoothing: Certified Robustness against Wasserstein Adversarial Attacks},
author = {Alexander Levine and Soheil Feizi},
journal= {arXiv preprint arXiv:1910.10783},
year = {2019}
}