利用生成模型构造无约束对抗样本
机器学习
2018-12-04 v4 人工智能
密码学与安全
计算机视觉与模式识别
机器学习
摘要
对抗样本通常通过在小矩阵范数内扰动现有数据点来构造,而当前的防御方法集中于防范此类攻击。在本文中,我们提出无约束对抗样本,一种攻击者不受小范数有界扰动限制的新威胁模型。与基于扰动的攻击不同,我们提出使用条件生成模型从零开始完全合成无约束对抗样本。具体而言,我们首先训练一个辅助分类器生成对抗网络(AC-GAN)来建模数据样本上的类条件分布。然后,在给定目标类别的条件下,我们在 AC-GAN 潜空间中进行搜索,以找到在生成模型下具有高似然且被目标分类器误分类的图像。我们通过人工评估证明,以此方式生成的无约束对抗样本是合法的且属于目标类别。我们在 MNIST、SVHN 和 CelebA 数据集上的实证结果表明,无约束对抗样本可以绕过为传统对抗攻击设计的强对抗训练和认证防御方法。
引用
@article{arxiv.1805.07894,
title = {Constructing Unrestricted Adversarial Examples with Generative Models},
author = {Yang Song and Rui Shu and Nate Kushman and Stefano Ermon},
journal= {arXiv preprint arXiv:1805.07894},
year = {2018}
}
备注
Neural Information Processing Systems (NeurIPS 2018)