面向生成模型的第一类攻击
计算机视觉与模式识别
2020-03-05 v1 机器学习
图像与视频处理
摘要
生成模型是应用广泛的流行工具。然而,它和分类器一样易受对抗样本攻击。现有攻击方法主要通过在输入上添加难以察觉的扰动来生成对抗样本,从而导致错误结果。然而,我们关注另一方面的攻击,即通过显著改变来欺骗模型。前者引发第二类错误,后者导致第一类错误。本文中,我们针对VAE和GAN等生成模型提出第一类攻击。VAE中的一个例子是:我们可以将原始图像显著改变为无意义图像,但其重建结果却相似。为实现第一类攻击,我们在输入空间中增大距离的同时保持输出相似,从而破坏原始样本,因为深度神经网络的特性使得不同输入可能对应相似特征。实验结果表明,我们的攻击方法能有效地在大规模图像数据集上为生成模型生成第一类对抗样本。
引用
@article{arxiv.2003.01872,
title = {Type I Attack for Generative Models},
author = {Chengjin Sun and Sizhe Chen and Jia Cai and Xiaolin Huang},
journal= {arXiv preprint arXiv:2003.01872},
year = {2020}
}