论MagNet防御对基于$L_1$对抗样本的局限性
计算机视觉与模式识别
2018-05-10 v2 密码学与安全
机器学习
机器学习
摘要
近年来,为保护经深度神经网络(DNNs)训练的鲁棒机器学习模型免受自然样本的对抗扰动,已成为深度学习与安全交叉领域的新兴研究方向。特别地,由对抗检测器与数据重整器构成的MagNet迄今是黑盒盲攻设置下最强防御之一,其中攻击者旨在从不受防御的DNN模型生成可迁移对抗样本,以绕过部署于同一DNN模型上的未知防御模块。此设置下,MagNet可成功防御DNN中的多种攻击,包括由Carlini和Wagner基于失真度量的攻击所生成的高置信度对抗样本。然而,本文在相同攻击设置下表明,基于失真度量构造的对抗样本可轻易绕过MagNet,并误导MNIST与CIFAR-10上的目标DNN图像分类器。我们还解释了该方法为何能产生具有优越攻击性能的对抗样本,并对MagNet的变体进行大量实验以验证其对基于失真攻击缺乏鲁棒性。值得注意的是,我们的结果大幅削弱了MagNet有效威胁模型的假设——该假设要求攻击DNN时知晓所部署防御技术(即灰盒攻击设置)。
引用
@article{arxiv.1805.00310,
title = {On the Limitation of MagNet Defense against $L_1$-based Adversarial Examples},
author = {Pei-Hsuan Lu and Pin-Yu Chen and Kang-Cheng Chen and Chia-Mu Yu},
journal= {arXiv preprint arXiv:1805.00310},
year = {2018}
}
备注
Accepted to IEEE/IFIP International Conference on Dependable and Systems and Networks (DSN) 2018 Workshop on Dependable and Secure Machine Learning