鲁棒流形防御:基于生成模型的对抗训练
计算机视觉与模式识别
2019-07-11 v5 密码学与安全
机器学习
机器学习
摘要
我们提出一种针对图像分类器寻找对抗样本的新型攻击。我们的方法利用spanner,即输入空间为低维且输出范围逼近目标图像集合的深度神经网络。Spanner可以是GAN的生成器或VAE的解码器。我们攻击的关键思想是在潜码对上搜索,以找到生成相近图像但分类器输出不同的潜码对。我们认为我们的攻击比在真实图像扰动上搜索更强。此外,我们表明我们更强的攻击可将Defense-GAN的准确率降至3%,解决了Athalye等人著名论文中的一个开放问题。我们将我们的攻击与常规对抗训练结合,获得了已知最鲁棒的MNIST分类器,显著改进了针对PGD攻击的最优水平。我们的公式涉及求解一个极小极大问题,其中极小方设置分类器参数,极大方运行我们的攻击,从而在spanner的{\em 低维}输入空间中搜索对抗样本。所有代码与模型可在\url{https://github.com/ajiljalal/manifold-defense.git}获取。
引用
@article{arxiv.1712.09196,
title = {The Robust Manifold Defense: Adversarial Training using Generative Models},
author = {Ajil Jalal and Andrew Ilyas and Constantinos Daskalakis and Alexandros G. Dimakis},
journal= {arXiv preprint arXiv:1712.09196},
year = {2019}
}
备注
Added pseudo code for defense-gan break