针对数字图像的视觉不可感知对抗补丁攻击
计算机视觉与模式识别
2021-04-28 v3 图像与视频处理
摘要
深度神经网络(DNNs)对对抗样本的脆弱性已引起更多关注。已有许多算法被提出以构造强大的对抗样本。然而,这些算法大多在忽略网络解释的情况下修改全局或局部像素区域,因而扰动是冗余的,易被肉眼察觉。本文提出一种生成局部区域扰动的新方法。其主要思想是通过模拟人类注意力机制寻找图像的贡献特征区域(CFR),随后向 CFR 添加扰动。进一步地,基于激活图设计了一个软掩码矩阵,以精细表示 CFR 中每个像素的贡献。借助该软掩码,我们开发了一种带逆温度的新损失函数,以在 CFR 中搜索最优扰动。由于网络解释性,添加于 CFR 的扰动比添加于其他区域的更有效。在 CIFAR-10 与 ILSVRC2012 上的大量实验证明了所提方法在攻击成功率、不可感知性与可迁移性方面的有效性。
引用
@article{arxiv.2012.00909,
title = {Visually Imperceptible Adversarial Patch Attacks on Digital Images},
author = {Yaguan Qian and Jiamin Wang and Bin Wang and Shaoning Zeng and Zhaoquan Gu and Shouling Ji and Wassim Swaileh},
journal= {arXiv preprint arXiv:2012.00909},
year = {2021}
}