当可解释性遇见对抗学习:利用 SHAP 特征检测对抗样本
机器学习
2019-09-10 v1 人工智能
密码学与安全
机器学习
摘要
最先进的深度神经网络(DNN)在解决许多复杂现实世界问题方面非常有效。然而,这些模型易受对抗性扰动攻击,尽管该领域研究众多,至今在对抗样本生成方法与检测防御方法的猫鼠游戏中,对手仍占上风。在本研究中,我们提出了一种新颖的检测方法,利用为 DNN 分类器内部层计算的 Shapley 加性解释(SHAP)值来区分正常输入与对抗输入。我们通过构建基于流行 CIFAR-10 和 MNIST 数据集的大规模对抗样本数据集,并训练基于神经网络的检测器来区分正常与对抗输入,从而评估我们的方法。我们针对多种最先进攻击生成的对抗样本评估了检测器,并展示了其高检测精度以及对不同攻击方法生成的对抗输入的强泛化能力。
引用
@article{arxiv.1909.03418,
title = {When Explainability Meets Adversarial Learning: Detecting Adversarial Examples using SHAP Signatures},
author = {Gil Fidel and Ron Bitton and Asaf Shabtai},
journal= {arXiv preprint arXiv:1909.03418},
year = {2019}
}