中文

对抗训练与针对多种扰动的鲁棒性

机器学习 2019-10-21 v2 密码学与安全 机器学习

摘要

针对对抗样本的防御(如对抗训练)通常针对单一扰动类型(例如小\ell_\infty-噪声)定制。对于其他扰动,这些防御不提供任何保证,有时甚至增加模型的脆弱性。我们的目标是理解这种鲁棒性权衡背后的原因,并训练同时对多种扰动类型鲁棒的模型。我们证明,在一个自然且简单的统计设定中,对不同类型p\ell_p-有界和空间扰动的鲁棒性必然存在权衡。我们通过在MNIST和CIFAR10上展示类似的鲁棒性权衡来佐证我们的形式化分析。基于新的多扰动对抗训练方案,以及一种用于寻找1\ell_1-有界对抗样本的新型高效攻击,我们表明,没有任何针对多种攻击训练的模型能达到与针对单个攻击分别训练的模型相竞争的鲁棒性。特别地,我们在MNIST上揭示了一种有害的梯度掩蔽现象,其导致使用一阶,1\ell_\infty, \ell_12\ell_2对抗者的对抗训练仅达到50%准确率。我们的结果质疑了将对抗鲁棒性和对抗训练扩展到多种扰动类型的可行性与计算可扩展性。

关键词

引用

@article{arxiv.1904.13000,
  title  = {Adversarial Training and Robustness for Multiple Perturbations},
  author = {Florian Tramèr and Dan Boneh},
  journal= {arXiv preprint arXiv:1904.13000},
  year   = {2019}
}

备注

Accepted at NeurIPS 2019, 23 pages