中文

面向提升对抗鲁棒性的替代技术:基于扰动谱的对抗训练分析

机器学习 2022-06-15 v1

摘要

对抗训练(AT)及其变体在过去几年中引领了提升神经网络对对抗扰动与常见损坏鲁棒性的进展。AT 及其变体的算法设计聚焦于在指定扰动强度 ϵ\epsilon 下训练模型,并仅利用该 ϵ\epsilon-鲁棒模型性能的反馈来改进算法。在本文中,我们关注在 ϵ\epsilon 值谱上训练的模型。我们分析三个视角:模型性能、中间特征精度与卷积滤波器敏感性。在每一视角中,我们识别出对 AT 的替代改进,这些改进在单一 ϵ\epsilon 下原本不会显现。具体而言,我们发现对于某强度 δ\delta 的 PGD 攻击,存在一个稍大强度 ϵ\epsilon(但不更大)的 AT 模型,其对它的泛化最佳。因此,我们提出为鲁棒性过度设计,建议以略高于 δ\deltaϵ\epsilon 训练模型。其次,我们观察到(跨各种 ϵ\epsilon 值)鲁棒性对中间特征的精度高度敏感,尤其是第一层与第二层之后的特征。因而,我们提出向防御中添加简单量化,以提升对已见与未见自适应攻击的准确率。第三,我们分析随 ϵ\epsilon 增大的各层模型卷积滤波器,注意到第一层与第二层的滤波器可能单独负责放大输入扰动。我们呈现我们的发现,并通过在 CIFAR-10 与 CIFAR-10-C 数据集上使用 ResNet 与 WideResNet 模型的实验演示我们的技术。

关键词

引用

@article{arxiv.2206.06496,
  title  = {Towards Alternative Techniques for Improving Adversarial Robustness: Analysis of Adversarial Training at a Spectrum of Perturbations},
  author = {Kaustubh Sridhar and Souradeep Dutta and Ramneet Kaur and James Weimer and Oleg Sokolsky and Insup Lee},
  journal= {arXiv preprint arXiv:2206.06496},
  year   = {2022}
}