针对多种扰动模型并集的对抗鲁棒性
机器学习
2020-07-30 v2 人工智能
机器学习
摘要
由于深度学习系统易受对抗攻击,已有大量工作致力于开发(经验上和可证明地)鲁棒的分类器。虽然大多数工作针对单一类型的攻击进行防御,但近期的研究通过简单聚合多种攻击来防御多个扰动模型。然而,这些方法难以调参,且容易对不同扰动模型产生不平衡的鲁棒程度,从而导致在并集上的最坏情况损失次优。在本工作中,我们提出了标准基于 PGD 的过程的自然推广,通过将最坏情况取遍所有最速下降方向,将多个扰动模型纳入单一攻击中。该方法的好处是直接收敛到不同扰动模型之间的权衡,从而最小化并集上的最坏情况性能。利用该方法,我们能够训练同时对 、 和 攻击鲁棒的标准架构,在 MNIST 和 CIFAR10 数据集上超越以往方法,并在后者上针对半径 = (0.03, 0.5, 12) 的 (, , ) 扰动并集取得 47.0% 的对抗准确率,优于先前取得 40.6% 准确率的方法。
引用
@article{arxiv.1909.04068,
title = {Adversarial Robustness Against the Union of Multiple Perturbation Models},
author = {Pratyush Maini and Eric Wong and J. Zico Kolter},
journal= {arXiv preprint arXiv:1909.04068},
year = {2020}
}
备注
ICML 2020 Final Version