通过扰动解码器中间层高层特征生成对抗样本
计算机视觉与模式识别
2021-10-15 v1 机器学习
摘要
我们提出一种生成对抗样本的新方法。不同于扰动像素,我们利用输入图像的编码器-解码器表示并扰动解码器的中间层。这改变了生成模型提供的高层特征。因此,我们的扰动具有语义含义,例如更长的喙或绿色色调。我们将该任务表述为一个优化问题,在误分类约束下最小化对抗图像与初始图像之间的 Wasserstein 距离。我们采用带简单非精确投影的投影梯度法。由于投影,所有迭代均可行,且我们的方法总能生成对抗图像。我们在 MNIST 和 ImageNet 数据集上以有目标与无目标设置进行了数值实验。我们证明,相较于基于像素的攻击,我们的对抗图像对隐写防御技术脆弱性低得多。此外,我们表明本方法修改了边缘等关键特征,且基于对抗训练的防御技术对我们的攻击脆弱。
引用
@article{arxiv.2110.07182,
title = {Adversarial examples by perturbing high-level features in intermediate decoder layers},
author = {Vojtěch Čermák and Lukáš Adam},
journal= {arXiv preprint arXiv:2110.07182},
year = {2021}
}