中文

无处遁形:一种轻量无监督对抗样本检测器

机器学习 2022-10-18 v1 密码学与安全

摘要

尽管深度神经网络(DNNs)在许多感知任务上表现出令人印象深刻的性能,但它们易受对抗样本的攻击,后者通过在良性图像上添加细微但精心设计的恶意扰动生成。对抗检测是一种在对抗样本进入目标DNNs之前识别它们的重要技术。先前检测对抗样本的研究要么针对特定攻击,要么需要昂贵的计算。如何设计轻量无监督检测器仍是一个挑战性问题。本文提出一种基于自动编码器的对抗样本(AEAE)检测器,能以无监督方式、低计算量检测对抗样本从而守护DNN模型。AEAE仅包含一个浅层自动编码器但扮演两个角色。首先,训练良好的自动编码器已学习良性样本的流形,可对具有大扰动的对抗图像产生较大重建误差,因此可基于重建误差检测显著扰动的对抗样本。其次,自动编码器可滤除小噪声并改变DNN对小幅扰动对抗样本的预测,有助于基于预测距离检测轻微扰动的对抗样本。为覆盖这两种情况,我们利用良性图像的重建误差与预测距离构造二元组特征集,并使用孤立森林算法训练对抗检测器。我们通过实验表明,AEAE在面对大多数最先进攻击时是无监督且低开销的。通过这两种情况的检测,对抗样本无处遁形。

关键词

引用

@article{arxiv.2210.08579,
  title  = {Nowhere to Hide: A Lightweight Unsupervised Detector against Adversarial Examples},
  author = {Hui Liu and Bo Zhao and Kehuan Zhang and Peng Liu},
  journal= {arXiv preprint arXiv:2210.08579},
  year   = {2022}
}