利用多样化决策边界抵御深度神经网络中的对抗攻击
机器学习
2022-08-19 v1 密码学与安全
计算机视觉与模式识别
摘要
深度学习(DL)系统的安全性是一个极为重要的研究领域,因为它们正被部署于多种应用中,其在解决挑战性任务上的性能不断提升。尽管前景广阔,深度学习系统却易受精心构造的对抗样本的攻击,这些样本可能为人眼难以察觉,却可导致模型误分类。基于集成技术的对抗扰动防护要么已被证明对更强对手脆弱,要么缺乏端到端评估。在本文中,我们试图开发一种新的基于集成的解决方案,其针对原始模型构造具有多样化决策边界的防御模型。通过(1)一种称为 Split-and-Shuffle 的方法对输入进行变换,以及(2)一种称为 Contrast-Significant-Features 的方法限制显著特征所构造的分类器集成,被证明能产生相对于对抗攻击的多样化梯度,这降低了将对抗样本从原始模型转移到针对同一类的防御模型的机会。我们使用标准图像分类数据集,即 MNIST、CIFAR-10 和 CIFAR-100,针对最先进的对抗攻击进行了大量实验,以证明所提基于集成的防御的鲁棒性。我们还评估了在针对集成内所有模型同时发起攻击的更强对手存在下的鲁棒性。给出了整体假阳性和假阴性的结果,以估计所提方法的整体性能。
引用
@article{arxiv.2208.08697,
title = {Resisting Adversarial Attacks in Deep Neural Networks using Diverse Decision Boundaries},
author = {Manaar Alam and Shubhajit Datta and Debdeep Mukhopadhyay and Arijit Mondal and Partha Pratim Chakrabarti},
journal= {arXiv preprint arXiv:2208.08697},
year = {2022}
}