中文

AdvCheck:通过局部梯度检验刻画对抗样本

密码学与安全 2023-04-03 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

深度神经网络(DNNs)易受对抗样本攻击,可能在安全关键领域引发灾难。已有大量检测方法用于刻画对抗样本的特征独特性,或区分由对抗样本激活的DNN行为。基于特征的检测无法处理大扰动对抗样本,且需要大量特定对抗样本。另一主流基于模型的检测通过模型行为刻画输入属性,但计算开销大。为解决这些问题,我们引入局部梯度概念,并揭示对抗样本的局部梯度上界远大于良性样本。受该观察启发,我们利用局部梯度检测对抗样本,提出通用框架AdvCheck。具体而言,通过由少量良性样本与加噪误分类样本计算局部梯度训练检测器,可精确区分对抗样本乃至误分类自然输入与良性样本。大量实验验证了AdvCheck优于最先进(SOTA)基线,对一般对抗攻击的检测率平均约提升1.2倍,对误分类自然输入约提升1.4倍,且平均时间开销为1/500。我们也提供了成功检测的可解释结果。

关键词

引用

@article{arxiv.2303.18131,
  title  = {AdvCheck: Characterizing Adversarial Examples via Local Gradient Checking},
  author = {Ruoxi Chen and Haibo Jin and Jinyin Chen and Haibin Zheng},
  journal= {arXiv preprint arXiv:2303.18131},
  year   = {2023}
}

备注

26 pages