中文

利用影响函数与最近邻检测对抗样本

机器学习 2020-03-20 v2 机器学习

摘要

深度神经网络(DNNs)因其对对抗攻击的脆弱性而臭名昭著,对抗攻击是添加到输入图像上的微小扰动,用以误导其预测。因此,对抗样本的检测是鲁棒分类框架的基本需求。本工作中,我们提出一种适用于任何预训练神经网络分类器的此类对抗攻击检测方法。我们使用影响函数衡量每个训练样本对验证集数据的影响。根据影响分数,我们为任意给定验证样本找到最具支持性的训练样本。在 DNN 激活层上拟合的 k-最近邻(k-NN)模型被用于搜索这些支持性训练样本的排序。我们观察到,这些样本与正常输入的近邻高度相关,而与对抗输入的相关性则弱得多。我们使用 k-NN 排序与距离训练了一个对抗检测器,并展示其成功区分了对抗样本,在三个数据集的六种攻击方法上取得了最先进(SOTA)结果。代码见 https://github.com/giladcohen/NNIF_adv_defense。

关键词

引用

@article{arxiv.1909.06872,
  title  = {Detecting Adversarial Samples Using Influence Functions and Nearest Neighbors},
  author = {Gilad Cohen and Guillermo Sapiro and Raja Giryes},
  journal= {arXiv preprint arXiv:1909.06872},
  year   = {2020}
}

备注

Paper accepted to CVPR 2020