何时不应分类:测试时针对DNN分类器的攻击异常检测(ADA)
机器学习
2018-06-29 v2 密码学与安全
摘要
对近期广泛部署的基于机器学习的系统(包括深度神经网络(DNNs))的一个重大威胁是对抗学习攻击。我们分析可能的测试时规避攻击机制,并表明在一些重要情况下,当图像被攻击时,正确分类它并无效用:i)当待攻击图像(即使任意地)选自攻击者的缓存;ii)当分类器决策的唯一接收者是攻击者。此外,在某些应用领域和场景中,无论面对攻击能否正确分类,检测该攻击都是高度可操作的(若未检测到攻击仍执行分类)。我们假设,即使人类不可感知,对抗扰动也是机器可检测的。我们提出一种纯无监督异常检测器(AD),与以往工作不同之处在于:i)使用高度合适的零假设密度模型对深层联合密度建模(特别匹配RELU层的非负支撑);ii)利用多个DNN层;iii)在构建基于Kullback-Leibler散度的新颖决策统计量时,利用“源”和“目的”类概念、源类不确定性、类混淆矩阵和DNN权重信息。在MNIST和CIFAR-10图像数据库上针对三种著名攻击策略测试,我们的方法优于以往检测方法,在两种攻击上取得强ROC AUC检测精度,并在最强(CW)攻击上取得优于近期报道的多种方法的精度。我们还评估了对我们系统的全白盒攻击。最后,我们评估其他重要性能指标,如分类精度对检测率和攻击强度。
引用
@article{arxiv.1712.06646,
title = {When Not to Classify: Anomaly Detection of Attacks (ADA) on DNN Classifiers at Test Time},
author = {David J. Miller and Yulia Wang and George Kesidis},
journal= {arXiv preprint arXiv:1712.06646},
year = {2018}
}