通过利用整个GAN抵御对抗攻击
机器学习
2018-05-29 v1 机器学习
摘要
近期工作表明,最先进的模型对输入的对抗扰动高度脆弱。我们提出cowboy,一种利用在同一数据集上训练的GAN的判别器和生成器来检测并防御对抗攻击的方法。我们展示判别器在多种攻击和数据集下始终将对抗样本评分低于真实样本。我们提供经验证据表明对抗样本位于GAN所学习的数据流形之外。基于此,我们提出一种清洗方法,利用GAN的判别器和生成器将样本投影回数据流形。该清洗过程独立于分类器和攻击类型,因此可部署于现有系统中。
引用
@article{arxiv.1805.10652,
title = {Defending Against Adversarial Attacks by Leveraging an Entire GAN},
author = {Gokula Krishnan Santhanam and Paulina Grnarova},
journal= {arXiv preprint arXiv:1805.10652},
year = {2018}
}