不可感知对抗图像扰动的逆向工程
计算机视觉与模式识别
2022-04-04 v2 人工智能
机器学习
摘要
人们已充分认识到,基于神经网络的图像分类器容易被带有由对抗者精心制作的微小扰动的图像所欺骗。已有大量研究用于生成和防御此类对抗攻击。然而,以下问题尚未被探索:如何从对抗图像中逆向工程对抗扰动?这引出了一种新的对抗学习范式——欺骗的逆向工程(RED)。若成功,RED 使我们能够估计对抗扰动并恢复原始图像。然而,精心制作的微小对抗扰动难以通过优化单方面的 RED 目标来恢复。例如,纯图像去噪方法可能过拟合于最小化重建误差,却几乎无法保留真实对抗扰动的分类属性。为应对这一挑战,我们形式化了 RED 问题并识别出对 RED 方法设计至关重要的一组原则。特别地,我们发现预测对齐和适当的数据增强(就空间变换而言)是实现可泛化 RED 方法的两个准则。通过将这些 RED 原则与图像去噪相结合,我们提出了一种基于类别判别去噪的 RED 框架,称为 CDD-RED。大量实验证明了 CDD-RED 在不同评估指标(从像素级、预测级到归因级对齐)和多种攻击生成方法(如 FGSM、PGD、CW、AutoAttack 及自适应攻击)下的有效性。
引用
@article{arxiv.2203.14145,
title = {Reverse Engineering of Imperceptible Adversarial Image Perturbations},
author = {Yifan Gong and Yuguang Yao and Yize Li and Yimeng Zhang and Xiaoming Liu and Xue Lin and Sijia Liu},
journal= {arXiv preprint arXiv:2203.14145},
year = {2022}
}