利用$L_2$对抗样本的敏感性实现擦除与修复检测
计算机视觉与模式识别
2020-12-15 v2 密码学与安全
机器学习
图像与视频处理
摘要
通过对输入图像添加精心构造的扰动,可生成对抗样本(AEs)以误导基于神经网络的图像分类器。Carlini和Wagner(CW)的对抗扰动是最有效且难以检测的攻击之一。尽管已提出许多针对AEs的防御措施,自适应CW- AEs的检测仍是一个开放问题。我们发现,通过随机擦除 AE中的部分像素并使用修复技术将其恢复,该AE在步骤前后的分类结果往往不同,而良性样本不会出现此现象。因此我们提出一种新颖的AE检测技术——擦除与修复(E&R),其利用了攻击这一引人注目的敏感性。在两个流行图像数据集CIFAR-10和ImageNet上的实验表明,所提技术能够检测超过98%的 AEs,且对良性图像的误报率极低。该检测技术表现出高可迁移性:使用CW- AEs训练的检测系统可准确检测由另一种攻击方法生成的AEs。更重要的是,我们的方法对自适应攻击展现出强韧性,填补了AE检测中的关键空白。最后,我们通过可视化和量化对该检测技术进行解释。
引用
@article{arxiv.2001.00116,
title = {Exploiting the Sensitivity of $L_2$ Adversarial Examples to Erase-and-Restore},
author = {Fei Zuo and Qiang Zeng},
journal= {arXiv preprint arXiv:2001.00116},
year = {2020}
}
备注
Accepted to AsiaCCS'21 on 10/24/2020; 12 pages; the code, datasets, and models will be made publicly available when the paper is presented