中文

Wasserstein 平滑:针对 Wasserstein 对抗攻击的认证鲁棒性

机器学习 2019-10-25 v1 机器学习

摘要

在过去几年中,针对图像分类问题已提出若干基于不同威胁模型的对抗攻击方法。大多数现有防御考虑加性威胁模型,其中样本扰动具有有界的 L_p 范数。然而,这些防御在非加性威胁模型下的对抗攻击中可能脆弱。基于非加性威胁模型的攻击方法一例是 Wong 等人(2019)提出的 Wasserstein 对抗攻击,其中图像与其对抗样本之间的距离由它们归一化像素强度之间的 Wasserstein 度量(“推土机距离”)决定。迄今尚无针对此类攻击的可认证防御。本工作中,我们提出首个利用随机平滑针对 Wasserstein 对抗攻击具有认证鲁棒性的防御。我们通过考虑图像间可能流的空间,并将该空间表示使得图像间 Wasserstein 距离由此流空间中的 L_1 距离上界限定,从而发展出该证书。我们随后可应用现有的 L_1 度量随机平滑证书。在 MNIST 与 CIFAR-10 数据集上,我们发现我们提出的防御在实践中也有效,相较于未保护模型在 Wasserstein 对抗攻击下展现出显著改进的准确率。

关键词

引用

@article{arxiv.1910.10783,
  title  = {Wasserstein Smoothing: Certified Robustness against Wasserstein Adversarial Attacks},
  author = {Alexander Levine and Soheil Feizi},
  journal= {arXiv preprint arXiv:1910.10783},
  year   = {2019}
}