利用隐空间投毒生成分布外对抗攻击
计算机视觉与模式识别
2022-03-08 v2 机器学习
摘要
传统的对抗攻击依赖于由网络梯度生成的扰动,这些扰动通常通过梯度引导搜索来防护,从而为网络提供对抗样本。本文提出了一种生成对抗样本的新机制:不破坏原始图像,而是利用其隐空间表示在保持感知质量完好并充当合法数据样本的同时篡改图像的内在结构。与基于梯度的攻击不同,隐空间投毒利用了分类器对训练集独立同分布建模的倾向,并通过生成分布外样本来欺骗分类器。我们训练了一个解耦变分自编码器(beta-VAE)以在隐空间中对数据建模,然后在将其误分类为目标标签的约束下,使用类条件分布函数向隐空间添加噪声扰动。我们在 MNIST、SVHN 和 CelebA 数据集上的实证结果表明,所生成的对抗样本能够轻易欺骗采用可证明鲁棒防御机制设计的鲁棒 l_0、l_2、l_inf 范数分类器。
引用
@article{arxiv.2012.05027,
title = {Generating Out of Distribution Adversarial Attack using Latent Space Poisoning},
author = {Ujjwal Upadhyay and Prerana Mukherjee},
journal= {arXiv preprint arXiv:2012.05027},
year = {2022}
}
备注
IEEE SPL 2021