针对生成模型的对抗样本
机器学习
2017-02-23 v1 机器学习
摘要
我们探索了在深度生成模型(如变分自编码器(VAE)和VAE-GAN)上生成对抗样本的方法。众所周知,深度学习架构容易受到对抗样本的攻击,但以往的工作集中于对抗样本在分类任务上的应用。深度生成模型因其能够对输入数据分布建模并从这些分布中生成逼真样本,近来变得流行。我们针对VAE和VAE-GAN架构提出了三类攻击,并在MNIST、SVHN和CelebA数据集上训练的网络中进行了演示。第一类攻击利用基于分类的对抗方法,将一个分类器附加到目标生成模型已训练好的编码器上,进而间接操纵潜在表示。第二类攻击直接使用VAE损失函数,从对抗样本生成目标重建图像。第三类攻击不再依赖分类或标准损失来获取梯度,而是直接针对源潜在表示与目标潜在表示之间的差异进行优化。我们还阐述了攻击者为何可能有兴趣对目标生成网络部署此类技术。
引用
@article{arxiv.1702.06832,
title = {Adversarial examples for generative models},
author = {Jernej Kos and Ian Fischer and Dawn Song},
journal= {arXiv preprint arXiv:1702.06832},
year = {2017}
}