基于潜空间风格变换的对抗防御
计算机视觉与模式识别
2022-03-07 v2 机器学习
摘要
机器学习模型已表现出对对抗攻击的脆弱性,更具体地说,是对抗样本导致的误分类。在本文中,我们通过检测可疑输入,研究一种针对高分辨率图像对抗攻击的、与攻击无关的防御方法。我们方法背后的直觉是:正常图像的本质特征通常与非本质风格变换(例如,略微改变人像的面部表情)保持一致。相比之下,对抗样本通常对此类变换敏感。在我们检测对抗样本的方法中,我们提出了一种基于 StyleGAN2 生成器并通过对抗训练(VASA)实现的不可逆自编码器(inVertible Autoencoder based on the StyleGAN2 generator via Adversarial training),将图像反演为揭示层次化风格的解耦潜码。然后,基于潜码与风格变换之间的对应关系,我们通过潜码偏移与重建构建一组具有非本质风格变换的编辑副本。这些编辑副本基于分类的一致性被用于区分对抗样本。
引用
@article{arxiv.2006.09701,
title = {Adversarial Defense by Latent Style Transformations},
author = {Shuo Wang and Surya Nepal and Alsharif Abuadbba and Carsten Rudolph and Marthie Grobler},
journal= {arXiv preprint arXiv:2006.09701},
year = {2022}
}