中文

利用对抗网络生成对抗样本

密码学与安全 2019-02-15 v5 计算机视觉与模式识别 机器学习

摘要

深度神经网络(DNNs)已被发现容易受到通过对输入添加小幅度扰动而产生的对抗样本的攻击。此类对抗样本可误导 DNNs 产生攻击者选定的结果。已有不同的攻击策略被提出用于生成对抗样本,但如何以更高的感知质量和更高的效率生成它们仍需更多研究努力。在本文中,我们提出 AdvGAN,利用生成对抗网络(GANs)生成对抗样本,其可以学习并近似原始实例的分布。对于 AdvGAN,一旦生成器训练完成,它就可以为任意实例高效生成对抗扰动,从而有可能加速作为防御的对抗训练。我们将 AdvGAN 应用于半白盒和黑盒攻击设置中。在半白盒攻击中,与传统的白盒攻击不同,生成器训练完成后无需访问原始目标模型。在黑盒攻击中,我们动态地为黑盒模型训练一个蒸馏模型并相应地优化生成器。与其他攻击相比,AdvGAN 在不同目标模型上生成的对抗样本在最优防御下具有更高的攻击成功率。我们的攻击在一个公开的 MNIST 黑盒攻击挑战中以 92.76% 的准确率位居第一。

关键词

引用

@article{arxiv.1801.02610,
  title  = {Generating Adversarial Examples with Adversarial Networks},
  author = {Chaowei Xiao and Bo Li and Jun-Yan Zhu and Warren He and Mingyan Liu and Dawn Song},
  journal= {arXiv preprint arXiv:1801.02610},
  year   = {2019}
}

备注

Accepted to IJCAI2018