CD-UAP:类可判别通用对抗扰动
计算机视觉与模式识别
2020-10-09 v1 密码学与安全
机器学习
摘要
单个通用对抗扰动(UAP)可加至所有自然图像以改变其大多数预测类别标签。对攻击者而言,灵活控制所攻击目标类别具有高度实际意义,然而现有UAP方法攻击来自所有类别的样本。本文提出一种新的通用攻击方法,生成单一扰动使目标网络仅将选定类别组误分类,而对其余类别影响有限。由于所提攻击生成的通用对抗扰动对目标与非目标类具有判别性,我们称之为类可判别通用对抗扰动(CD-UAP)。我们提出一个简单而有效的算法框架,并在其下设计并比较了多种针对类可判别通用攻击的损失函数配置。所提方法已在多个基准数据集上通过大量实验评估。此外,我们提出的方法在UAP攻击所有类的原始任务上达到了最先进(SOTA)性能,证明了方法的有效性。
引用
@article{arxiv.2010.03300,
title = {CD-UAP: Class Discriminative Universal Adversarial Perturbation},
author = {Chaoning Zhang and Philipp Benz and Tooba Imtiaz and In So Kweon},
journal= {arXiv preprint arXiv:2010.03300},
year = {2020}
}