利用自适应降噪检测深度网络中的对抗图像样本
密码学与安全
2019-01-10 v5 机器学习
摘要
近期,许多研究表明深度神经网络(DNN)分类器可被对抗样本欺骗,该样本是通过向原始样本中引入一些扰动而精心构造的。相应地,一些强大的防御技术被提出。然而,现有的防御技术通常需要修改目标模型或依赖于攻击的先验知识。在本文中,我们提出了一种直接的对抗图像样本检测方法,该方法可直接部署于未修改的现成 DNN 模型中。我们将图像扰动视为一种噪声,并引入两种经典的图像处理技术——标量量化与平滑空间滤波器——来减轻其影响。采用图像熵作为度量,对不同类型的图像实现自适应降噪。因此,通过比较给定样本与其降噪版本的分类结果,可以在不参考任何攻击先验知识的情况下有效检测对抗样本。我们使用针对一些最先进(SOTA)DNN 模型生成的 20,000 多个对抗样本评估了所提出的方法,这些样本是利用不同的攻击技术精心构造的。实验表明,我们的检测方法能够达到 96.39% 的高总体 F1 分数,这无疑提高了防御感知攻击的门槛。
引用
@article{arxiv.1705.08378,
title = {Detecting Adversarial Image Examples in Deep Networks with Adaptive Noise Reduction},
author = {Bin Liang and Hongcheng Li and Miaoqiang Su and Xirong Li and Wenchang Shi and Xiaofeng Wang},
journal= {arXiv preprint arXiv:1705.08378},
year = {2019}
}
备注
14 pages, http://ieeexplore.ieee.org/stamp/stamp.jsp?tp=&arnumber=8482346&isnumber=4358699