揭示对抗训练针对范数有界对抗样本的极限
机器学习
2021-03-31 v3 人工智能
机器学习
摘要
对抗训练及其变体已成为学习鲁棒深度神经网络的事实标准。在本文中,我们探索对抗训练周边的图景以揭示其极限。我们系统地研究了不同训练损失、模型规模、激活函数、无标注数据(通过伪标注)的加入以及其他因素对对抗鲁棒性的影响。我们发现,通过结合更大的模型、Swish/SiLU 激活函数与模型权重平均,可以训练出远超最先进结果的鲁棒模型。我们在 CIFAR-10 与 CIFAR-100 上针对尺寸分别为 与 的 与 范数有界扰动展示了大幅改进。在含有额外无标注数据的设定下,我们在 CIFAR-10 上针对尺寸 的 扰动取得了 65.88% 的受攻击准确率(相较先前最优 +6.35%)。在无额外数据时,我们取得 57.20% 的受攻击准确率(+3.46%)。为检验我们发现的普适性且不作任何额外修改,我们在 CIFAR-10 上针对尺寸 的 扰动取得 80.53% 的受攻击准确率(+7.62%),在 CIFAR-100 上针对尺寸 的 扰动取得 36.88% 的受攻击准确率(+8.46%)。所有模型可在 https://github.com/deepmind/deepmind-research/tree/master/adversarial_robustness 获取。
引用
@article{arxiv.2010.03593,
title = {Uncovering the Limits of Adversarial Training against Norm-Bounded Adversarial Examples},
author = {Sven Gowal and Chongli Qin and Jonathan Uesato and Timothy Mann and Pushmeet Kohli},
journal= {arXiv preprint arXiv:2010.03593},
year = {2021}
}
备注
Fixed minor formatting issues and added link to models