中文

L2对抗样本本质上是否不同?

计算机视觉与模式识别 2020-09-08 v2

摘要

深度神经网络(DNN)已在包括诸多安全相关场景的各类任务中取得显著成功。然而,大量工作已证明其易受对抗样本攻击。我们通过理论分析揭示了能够从本质上区分对抗样本与正常输入的性质。即,由L2L_2攻击生成的对抗样本通常具有更大的输入敏感度,可用于高效识别它们。我们还发现,由LL_\infty攻击生成的样本在像素域上差异足够大,可通过经验方法检测。为验证我们的分析,我们提出了一种引导互补防御模块(GCD),集成了检测与恢复过程。与对抗检测方法相比,我们的检测器对大多数攻击的检测AUC超过0.98。将我们的引导校正器与常用的对抗训练方法及其他校正方法比较,我们的校正器大幅优于它们。针对L2L_2攻击,我们在MNIST上恢复分类准确率达99%,在CIFAR-10上达89%,在ImageNet子集上达87%。此外,在白盒设定下,我们的整体防御模块展现出可观的鲁棒性。因此,我们确认至少L2L_2对抗样本在理论与经验上均与普通输入存在本质差异。并基于这些性质为设计简单而有效的防御方法提供了思路。

关键词

引用

@article{arxiv.2002.12527,
  title  = {Are L2 adversarial examples intrinsically different?},
  author = {Mingxuan Li and Jingyuan Wang and Yufan Wu},
  journal= {arXiv preprint arXiv:2002.12527},
  year   = {2020}
}