中文

大规模对抗训练的有趣特性

计算机视觉与模式识别 2019-12-24 v2

摘要

对抗训练是针对对抗攻击的主要防御手段之一。本文首次对对抗训练要素进行严谨的诊断研究,揭示了两个有趣特性。首先,我们研究归一化的作用。批量归一化(BN)是在许多视觉任务上取得最先进性能的关键要素,但我们表明它可能阻碍网络在对抗训练中获得强鲁棒性。一个意外的观察是,对于用 BN 训练的模型,仅从训练数据中移除干净图像就能大幅提升对抗鲁棒性,即 18.3%。我们将此现象与以下假设关联:干净图像和对抗图像来自两个不同的域。这一双域假设或可解释 BN 在混合干净与对抗图像训练时的问题,因为估计该混合分布的标准化统计量是困难的。受双域假设指导,我们表明解耦混合分布用于归一化,即对干净和对抗图像分别应用 BN 进行统计估计,可实现强得多的鲁棒性。此外,我们发现强制 BN 在训练和测试时行为一致可进一步增强鲁棒性。其次,我们研究网络容量的作用。我们发现所谓的“深度”网络对于对抗学习任务而言仍然很浅。不同于传统分类任务中向“深度”网络添加更多层仅边际提升准确率(如 ResNet-152),对抗训练对更深网络以实现更高对抗鲁棒性表现出强烈需求。即使将网络容量推至前所未有的规模(即 ResNet-638),这种鲁棒性提升也能大幅且持续地观察到。

关键词

引用

@article{arxiv.1906.03787,
  title  = {Intriguing properties of adversarial training at scale},
  author = {Cihang Xie and Alan Yuille},
  journal= {arXiv preprint arXiv:1906.03787},
  year   = {2019}
}

备注

To appear in ICLR 2020