中文

防御引导的可迁移对抗攻击

机器学习 2020-11-05 v2 计算机视觉与模式识别

摘要

尽管深度神经网络在挑战性任务上表现出色,但它们易受对抗样本的攻击,后者通过在干净输入上施加人眼难以察觉的扰动来误导分类器。在无需查询的黑盒场景下,对抗样本难以迁移至未知模型,已有若干方法存在迁移性较低的问题。为解决该问题,我们受输入变换启发设计了一个极大极小框架,该框架对对抗攻击与防御均有益。具体而言,在极小步骤中,我们利用输入的仿射变换作为防御来降低损失值;随后在极大步骤中,利用动量迭代算法作为攻击来提升损失值。为进一步提升迁移性,我们基于极大极小理论确定变换值。在 ImageNet 上的大量实验表明,我们的防御引导可迁移攻击在迁移性上取得了显著提升。实验上,我们的对抗攻击攻击成功率(ASR)平均达到 58.38%,在常规训练模型上优于最先进方法 12.1%,在对抗训练模型上优于 11.13%。此外,我们对迁移性的提升提供了可解释性见解,并期望我们的方法能作为评估深度模型鲁棒性的基准。

关键词

引用

@article{arxiv.2010.11535,
  title  = {Defense-guided Transferable Adversarial Attacks},
  author = {Zifei Zhang and Kai Qiao and Jian Chen and Ningning Liang},
  journal= {arXiv preprint arXiv:2010.11535},
  year   = {2020}
}