中文

从提取非鲁棒且高预测性的对抗扰动中检测与恢复对抗样本

计算机视觉与模式识别 2022-08-31 v2

摘要

深度神经网络(DNNs)已被证明易受对抗样本(AEs)的攻击,后者被恶意设计以欺骗目标模型。添加了难以察觉的对抗扰动的正常样本(NEs)可对 DNNs 构成安全威胁。尽管现有 AEs 检测方法已取得高准确率,但它们未能利用所检测 AEs 的信息。因此,基于高维扰动提取,我们提出一种无模型的 AEs 检测方法,其全过程无需查询受害模型。研究表明 DNNs 对高维特征敏感。隐藏在对抗样本中的对抗扰动属于高维特征,其具有高预测性和非鲁棒性。DNNs 从高维数据中学习到的细节多于其他数据。在我们的方法中,扰动提取器可将 AEs 中的对抗扰动作为高维特征提取出来,随后训练好的 AEs 判别器判定输入是否为 AE。实验结果表明,所提方法不仅能以高准确率检测对抗样本,还能检测 AEs 的具体类别。同时,提取的扰动可用于将 AEs 恢复为 NEs。

关键词

引用

@article{arxiv.2206.15128,
  title  = {Detecting and Recovering Adversarial Examples from Extracting Non-robust and Highly Predictive Adversarial Perturbations},
  author = {Mingyu Dong and Jiahao Chen and Diqun Yan and Jingxing Gao and Li Dong and Rangding Wang},
  journal= {arXiv preprint arXiv:2206.15128},
  year   = {2022}
}

备注

10 pages