梯度相似性:一种可解释的深度学习对抗攻击检测方法
计算机视觉与模式识别
2018-06-29 v1 密码学与安全
机器学习
摘要
深度神经网络易受微小但特定的对抗扰动的影响,这些扰动能够欺骗网络。这一漏洞在安全关键应用中可能导致潜在的有害后果。为解决该漏洞,我们提出了一种称为梯度相似性(Gradient Similarity)的新度量,使我们能够捕捉训练数据对测试输入的影响。我们表明,梯度相似性对于正常输入和对抗输入表现出不同的行为,并使我们能够以接近完美的 95-100% 的 ROC-AUC 检测多种对抗攻击。即使配备系统完美知识的白盒对手也无法轻易绕过我们的检测器。在 MNIST 数据集上,白盒攻击要么以 87-96% 的高 ROC-AUC 被检测出来,要么需要非常高的失真度才能绕过我们的检测器。
引用
@article{arxiv.1806.10707,
title = {Gradient Similarity: An Explainable Approach to Detect Adversarial Attacks against Deep Learning},
author = {Jasjeet Dhaliwal and Saurabh Shintre},
journal= {arXiv preprint arXiv:1806.10707},
year = {2018}
}
备注
11 pages, 6 figures