中文

对抗扰动跨域可迁移性

计算机视觉与模式识别 2019-10-16 v5

摘要

对抗样本揭示了深度神经网络(DNNs)的盲点,并代表了对安全关键应用的重大关切。对抗样本的迁移性使得在黑盒设定下的真实世界攻击成为可能,其中攻击者被禁止访问模型的内部参数。大多数对抗生成方法(无论是学习实例特定还是实例无关的扰动)的底层假设是直接或间接依赖于原始特定域数据分布。本工作中,我们首次展示了域不变对抗样本的存在,从而揭示了不同数据集与模型间的公共对抗空间。为此,我们提出一个能够发起高迁移性攻击的框架,其构造对抗模式以误导在完全不同域上训练的网络。例如,在绘画、卡通或医学图像上学习的对抗函数可成功扰动 ImageNet 样本以欺骗分类器,成功率高达 \sim99\%(10\ell_{\infty} \le 10)。我们提出的对抗函数核心是一个生成网络,使用相对论监督信号训练以实现域不变扰动。我们的方法在白盒与黑盒场景下均树立了欺骗率的新 SOTA。此外,尽管是实例无关扰动函数,我们的攻击优于传统上强得多的实例特定攻击方法。

关键词

引用

@article{arxiv.1905.11736,
  title  = {Cross-Domain Transferability of Adversarial Perturbations},
  author = {Muzammal Naseer and Salman H. Khan and Harris Khan and Fahad Shahbaz Khan and Fatih Porikli},
  journal= {arXiv preprint arXiv:1905.11736},
  year   = {2019}
}

备注

Accepted at NeurIPS 2019 (Camera Ready). Source Code along with pretrained adversarial generators is available at https://github.com/Muzammal-Naseer/Cross-domain-perturbations