中文

一种受神经启发的对抗扰动自编码防御方法

机器学习 2020-12-23 v2 密码学与安全

摘要

深度神经网络(DNNs)易受对抗攻击:对图像精心构造的扰动虽为人眼难以察觉,却会严重损害分类精度。尽管已有大量关于防御此类攻击的研究,但基于系统设计原则的大多数防御已被适当修改的攻击所攻破。对于固定的数据集,当前最有效的防御是使用对抗扰动的样本来训练网络。在本文中,我们研究了一种根本不同的、受神经启发的防御机制,其出发点在于观察到人类视觉几乎不受为机器设计的对抗样本影响。我们旨在利用具有生物视觉中常见特征的编码器,在L^inf有界对抗扰动到达分类器DNN之前将其拒止:稀疏过完备表示、由突触噪声引起的随机性,以及剧烈的非线性。编码器训练是无监督的,使用标准字典学习。基于CNN的解码器将编码器输出的尺寸恢复到原始图像大小,从而能够使用标准CNN进行分类。我们的标称设计是以标准监督方式联合训练解码器和分类器,但我们也考虑了基于回归目标(如常规自编码器)的无监督解码器训练,并对分类器进行独立的监督训练。与对抗训练不同,所有训练均基于干净图像。我们在CIFAR-10上的实验显示出与基于对抗训练的最先进防御相竞争的性能,并指出了受神经启发的技术在设计鲁棒神经网络方面的前景。此外,我们给出了Imagenet数据集子集上的结果,以验证我们的方法可扩展到更大的图像。

关键词

引用

@article{arxiv.2011.10867,
  title  = {A Neuro-Inspired Autoencoding Defense Against Adversarial Perturbations},
  author = {Can Bakiskan and Metehan Cekic and Ahmet Dundar Sezer and Upamanyu Madhow},
  journal= {arXiv preprint arXiv:2011.10867},
  year   = {2020}
}