中文

区域图像扰动在保持模型间可迁移性的同时降低对抗样本的 $L_p$ 范数

机器学习 2020-07-21 v2 计算机视觉与模式识别 机器学习

摘要

区域对抗攻击常依赖复杂方法生成对抗扰动,难以将其功效与知名攻击进行比较。本研究中,我们展示无需借助复杂方法即可生成有效的区域扰动。我们利用对抗机器学习中最常用的损失之一——交叉熵符号,开发了一种非常简单的区域对抗扰动攻击方法。我们在 ImageNet 上针对多个模型的实验揭示,当扰动施加于局部图像区域时,平均有 76%76\% 生成的对抗样本保持模型间可迁移性。根据所选区域不同,这些局部化对抗样本相比非局部对应样本所需 LpL_p 范数畸变(对于 p{0,2,}p \in \{0, 2, \infty\})显著更小。因此,这些局部化攻击有可能破坏那些声称在上述范数下具有鲁棒性的防御。

关键词

引用

@article{arxiv.2007.03198,
  title  = {Regional Image Perturbation Reduces $L_p$ Norms of Adversarial Examples While Maintaining Model-to-model Transferability},
  author = {Utku Ozbulak and Jonathan Peck and Wesley De Neve and Bart Goossens and Yvan Saeys and Arnout Van Messem},
  journal= {arXiv preprint arXiv:2007.03198},
  year   = {2020}
}

备注

Accepted for the ICML 2020, Workshop on Uncertainty and Robustness in Deep Learning (UDL)