中文

论MagNet防御对基于$L_1$对抗样本的局限性

计算机视觉与模式识别 2018-05-10 v2 密码学与安全 机器学习 机器学习

摘要

近年来,为保护经深度神经网络(DNNs)训练的鲁棒机器学习模型免受自然样本的对抗扰动,已成为深度学习与安全交叉领域的新兴研究方向。特别地,由对抗检测器与数据重整器构成的MagNet迄今是黑盒盲攻设置下最强防御之一,其中攻击者旨在从不受防御的DNN模型生成可迁移对抗样本,以绕过部署于同一DNN模型上的未知防御模块。此设置下,MagNet可成功防御DNN中的多种攻击,包括由Carlini和Wagner基于L2L_2失真度量的攻击所生成的高置信度对抗样本。然而,本文在相同攻击设置下表明,基于L1L_1失真度量构造的对抗样本可轻易绕过MagNet,并误导MNIST与CIFAR-10上的目标DNN图像分类器。我们还解释了该方法为何能产生具有优越攻击性能的对抗样本,并对MagNet的变体进行大量实验以验证其对基于L1L_1失真攻击缺乏鲁棒性。值得注意的是,我们的结果大幅削弱了MagNet有效威胁模型的假设——该假设要求攻击DNN时知晓所部署防御技术(即灰盒攻击设置)。

关键词

引用

@article{arxiv.1805.00310,
  title  = {On the Limitation of MagNet Defense against $L_1$-based Adversarial Examples},
  author = {Pei-Hsuan Lu and Pin-Yu Chen and Kang-Cheng Chen and Chia-Mu Yu},
  journal= {arXiv preprint arXiv:1805.00310},
  year   = {2018}
}

备注

Accepted to IEEE/IFIP International Conference on Dependable and Systems and Networks (DSN) 2018 Workshop on Dependable and Secure Machine Learning