中文

用于对抗鲁棒性的特征损失

计算机视觉与模式识别 2019-12-11 v1 密码学与安全 机器学习 图像与视频处理

摘要

深度学习在图像分类等计算机视觉任务中取得了巨大进展。然而,近期研究表明,深度学习模型易受人类几乎难以察觉的特制对抗输入的攻击。在本工作中,我们提出一种防御对抗攻击的新方法。我们采用基于去噪自编码器的输入处理技术作为防御。已有研究表明,输入扰动在通过卷积神经网络(CNN)传播时会作为噪声在特征图中增长并累积。我们利用这些含噪特征图,通过额外的子网络提取图像特征图,并基于这些特征图的感知损失训练一个自编码器。该技术在防御 MNIST 与 CIFAR10 数据集上取得了接近最优(state-of-the-art)的结果,但更重要的是,展示了一种无法被攻击方轻易端到端训练的防御应用新途径。实证结果证明了该方法在 MNIST 与 CIFAR10 数据集上针对简单及迭代 LP 攻击的有效性。我们的方法可作为预处理技术应用于任何现成的 CNN。

关键词

引用

@article{arxiv.1912.04497,
  title  = {Feature Losses for Adversarial Robustness},
  author = {Kirthi Shankar Sivamani},
  journal= {arXiv preprint arXiv:1912.04497},
  year   = {2019}
}