Defense-GAN:利用生成模型保护分类器抵御对抗攻击
计算机视觉与模式识别
2018-05-21 v2 机器学习
机器学习
摘要
近年来,深度神经网络方法被广泛采用用于机器学习任务,包括分类。然而,它们被证明易受对抗扰动的影响:精心构造的小扰动可导致合法图像被误分类。我们提出Defense-GAN,一种利用生成模型表达能力来保护深度神经网络免受此类攻击的新框架。Defense-GAN被训练来建模未受扰动图像的分布。在推理时,它寻找一个不含对抗性变化的、与给定图像相近的输出。然后将该输出送入分类器。我们提出的方法可用于任何分类模型,且不修改分类器结构或训练过程。它也可用作针对任何攻击的防御,因为它不假设生成对抗样本的过程的知识。我们经验性地表明Defense-GAN对不同攻击方法始终有效,并改进了现有防御策略。我们的代码已公开于 https://github.com/kabkabm/defensegan
引用
@article{arxiv.1805.06605,
title = {Defense-GAN: Protecting Classifiers Against Adversarial Attacks Using Generative Models},
author = {Pouya Samangouei and Maya Kabkab and Rama Chellappa},
journal= {arXiv preprint arXiv:1805.06605},
year = {2018}
}
备注
Published as a conference paper at the Sixth International Conference on Learning Representations (ICLR 2018)