中文

针对多种扰动模型并集的对抗鲁棒性

机器学习 2020-07-30 v2 人工智能 机器学习

摘要

由于深度学习系统易受对抗攻击,已有大量工作致力于开发(经验上和可证明地)鲁棒的分类器。虽然大多数工作针对单一类型的攻击进行防御,但近期的研究通过简单聚合多种攻击来防御多个扰动模型。然而,这些方法难以调参,且容易对不同扰动模型产生不平衡的鲁棒程度,从而导致在并集上的最坏情况损失次优。在本工作中,我们提出了标准基于 PGD 的过程的自然推广,通过将最坏情况取遍所有最速下降方向,将多个扰动模型纳入单一攻击中。该方法的好处是直接收敛到不同扰动模型之间的权衡,从而最小化并集上的最坏情况性能。利用该方法,我们能够训练同时对 \ell_\infty2\ell_21\ell_1 攻击鲁棒的标准架构,在 MNIST 和 CIFAR10 数据集上超越以往方法,并在后者上针对半径 = (0.03, 0.5, 12) 的 (\ell_\infty, 2\ell_2, 1\ell_1) 扰动并集取得 47.0% 的对抗准确率,优于先前取得 40.6% 准确率的方法。

关键词

引用

@article{arxiv.1909.04068,
  title  = {Adversarial Robustness Against the Union of Multiple Perturbation Models},
  author = {Pratyush Maini and Eric Wong and J. Zico Kolter},
  journal= {arXiv preprint arXiv:1909.04068},
  year   = {2020}
}

备注

ICML 2020 Final Version