基于结构到信号自编码器的对抗防御
机器学习
2018-03-22 v1 计算机视觉与模式识别
机器学习
摘要
对抗攻击方法揭示了深度神经网络的脆弱性。其不可察觉的扰动通常能欺骗分类器,导致潜在危险的误分类。我们提出了一种新方法,从分类器实际使用的有效输入信号角度来解释对抗扰动。基于此,我们应用经特殊训练的自编码器(称为 S2SNets)作为防御机制。它们遵循两阶段训练方案:首先进行无监督训练,随后利用现有分类器的梯度对解码器进行微调。S2SNets 诱导了通过其传播的梯度分布的偏移,剥离了其中的类别相关信号。我们在大型 ImageNet 数据集上分析了它们对几种白盒和灰盒场景的鲁棒性。我们的方法在白盒攻击场景中达到了与其他 SOTA 防御方法在灰盒场景中相当的抵抗力。我们进一步分析了 AlexNet、VGG 16、ResNet 50 和 Inception v3 在对抗空间中的关系,发现 VGG 16 最易被欺骗,而来自 ResNet 50 的扰动可转移性最强。
引用
@article{arxiv.1803.07994,
title = {Adversarial Defense based on Structure-to-Signal Autoencoders},
author = {Joachim Folz and Sebastian Palacio and Joern Hees and Damian Borth and Andreas Dengel},
journal= {arXiv preprint arXiv:1803.07994},
year = {2018}
}