用于对抗鲁棒性的特征损失
计算机视觉与模式识别
2019-12-11 v1 密码学与安全
机器学习
图像与视频处理
摘要
深度学习在图像分类等计算机视觉任务中取得了巨大进展。然而,近期研究表明,深度学习模型易受人类几乎难以察觉的特制对抗输入的攻击。在本工作中,我们提出一种防御对抗攻击的新方法。我们采用基于去噪自编码器的输入处理技术作为防御。已有研究表明,输入扰动在通过卷积神经网络(CNN)传播时会作为噪声在特征图中增长并累积。我们利用这些含噪特征图,通过额外的子网络提取图像特征图,并基于这些特征图的感知损失训练一个自编码器。该技术在防御 MNIST 与 CIFAR10 数据集上取得了接近最优(state-of-the-art)的结果,但更重要的是,展示了一种无法被攻击方轻易端到端训练的防御应用新途径。实证结果证明了该方法在 MNIST 与 CIFAR10 数据集上针对简单及迭代 LP 攻击的有效性。我们的方法可作为预处理技术应用于任何现成的 CNN。
引用
@article{arxiv.1912.04497,
title = {Feature Losses for Adversarial Robustness},
author = {Kirthi Shankar Sivamani},
journal= {arXiv preprint arXiv:1912.04497},
year = {2019}
}