区域同质性:面向可迁移通用对抗扰动以攻击防御模型的学习
计算机视觉与模式识别
2020-08-03 v2
摘要
本文专注于学习可迁移的对抗样本, specifically 针对防御模型(防御对抗攻击的模型)。特别地,我们展示了一种简单的通用扰动可以愚弄一系列最先进的防御方法。现有攻击生成的对抗样本通常难以迁移到防御模型。我们观察到对抗扰动中的区域同质性属性,并指出防御方法对区域同质的扰动鲁棒性较弱。因此,我们提出了一种有效的变换范式和一个定制的梯度变换器模块,将现有扰动转换为区域同质的扰动。在没有显式强制扰动为通用的情况下,我们观察到训练良好的梯度变换器模块倾向于输出与输入无关的梯度(因而是通用的),这得益于欠拟合现象。充分的实验表明,在基于迁移的攻击设定下攻击 9 种防御方法时,我们的工作比先前最优的攻击算法(无论是图像相关还是通用的)平均提升 14.0%。除跨模型可迁移性外,我们还验证了区域同质扰动能很好地跨不同视觉任务迁移(以语义分割任务攻击并在目标检测任务上测试)。代码见:https://github.com/LiYingwei/Regional-Homogeneity。
引用
@article{arxiv.1904.00979,
title = {Regional Homogeneity: Towards Learning Transferable Universal Adversarial Perturbations Against Defenses},
author = {Yingwei Li and Song Bai and Cihang Xie and Zhenyu Liao and Xiaohui Shen and Alan L. Yuille},
journal= {arXiv preprint arXiv:1904.00979},
year = {2020}
}
备注
ECCV 2020. Project page: https://github.com/LiYingwei/Regional-Homogeneity