中文

利用$L_2$对抗样本的敏感性实现擦除与修复检测

计算机视觉与模式识别 2020-12-15 v2 密码学与安全 机器学习 图像与视频处理

摘要

通过对输入图像添加精心构造的扰动,可生成对抗样本(AEs)以误导基于神经网络的图像分类器。Carlini和Wagner(CW)的L2L_2对抗扰动是最有效且难以检测的攻击之一。尽管已提出许多针对AEs的防御措施,自适应CW-L2L_2 AEs的检测仍是一个开放问题。我们发现,通过随机擦除L2L_2 AE中的部分像素并使用修复技术将其恢复,该AE在步骤前后的分类结果往往不同,而良性样本不会出现此现象。因此我们提出一种新颖的AE检测技术——擦除与修复(E&R),其利用了L2L_2攻击这一引人注目的敏感性。在两个流行图像数据集CIFAR-10和ImageNet上的实验表明,所提技术能够检测超过98%的L2L_2 AEs,且对良性图像的误报率极低。该检测技术表现出高可迁移性:使用CW-L2L_2 AEs训练的检测系统可准确检测由另一种L2L_2攻击方法生成的AEs。更重要的是,我们的方法对自适应L2L_2攻击展现出强韧性,填补了AE检测中的关键空白。最后,我们通过可视化和量化对该检测技术进行解释。

关键词

引用

@article{arxiv.2001.00116,
  title  = {Exploiting the Sensitivity of $L_2$ Adversarial Examples to Erase-and-Restore},
  author = {Fei Zuo and Qiang Zeng},
  journal= {arXiv preprint arXiv:2001.00116},
  year   = {2020}
}

备注

Accepted to AsiaCCS'21 on 10/24/2020; 12 pages; the code, datasets, and models will be made publicly available when the paper is presented