基于归因驱动的因果分析检测对抗样本
机器学习
2019-03-15 v1 机器学习
摘要
归因方法已被开发用于解释机器学习模型在给定输入上的决策。我们使用积分梯度(Integrated Gradient)方法寻找归因,通过逐步掩蔽高归因特征来定义输入的因果邻域。我们研究了机器学习模型在该邻域内对良性输入与对抗输入的鲁棒性。我们的研究表明,良性输入对高归因特征的掩蔽具有鲁棒性,但由 DeepFool、FGSM、CW 和 PGD 等最先进对抗攻击方法生成的对抗输入对此类掩蔽不具备鲁棒性。进一步,我们的研究证明,导致错误决策的高归因特征的集中现象在物理可实现的对抗样本中更为显著。这种良性与对抗输入在归因上的差异可用于检测对抗样本。此类防御方法独立于训练数据与攻击方法,我们证明了其在数字与物理可实现扰动上的有效性。
引用
@article{arxiv.1903.05821,
title = {Attribution-driven Causal Analysis for Detection of Adversarial Examples},
author = {Susmit Jha and Sunny Raj and Steven Lawrence Fernandes and Sumit Kumar Jha and Somesh Jha and Gunjan Verma and Brian Jalaian and Ananthram Swami},
journal= {arXiv preprint arXiv:1903.05821},
year = {2019}
}
备注
11 pages, 6 figures