以彼之道还施彼身:利用对抗梯度方向检测对抗样本
计算机视觉与模式识别
2021-01-01 v1 机器学习
摘要
对抗样本是专门构造以欺骗机器学习分类器的输入样本。最先进的对抗样本检测方法要么通过量化多次扰动下特征变化的幅度,要么通过测量其与估计的良性样本分布的距离,将输入样本判定为对抗样本。与这类度量不同,所提方法基于如下观察:在构造(新的)对抗样本时,对抗梯度的方向在刻画对抗空间方面起着关键作用。与使用多次扰动的检测方法相比,所提方法仅需对输入样本施加一次随机扰动,因而高效。在 CIFAR-10 和 ImageNet 两个数据库上的实验表明,所提检测方法在五种不同对抗攻击上分别取得了 97.9% 和 98.6% 的平均 AUC-ROC,并优于多种最先进的检测方法。结果证明了利用对抗梯度方向进行对抗样本检测的有效性。
引用
@article{arxiv.2012.15386,
title = {Beating Attackers At Their Own Games: Adversarial Example Detection Using Adversarial Gradient Directions},
author = {Yuhang Wu and Sunpreet S. Arora and Yanhong Wu and Hao Yang},
journal= {arXiv preprint arXiv:2012.15386},
year = {2021}
}
备注
Accepted at AAAI 2021