彼之敝草,吾之珍宝:以对抗样本抵御对抗样本
机器学习
2019-12-02 v2 计算机视觉与模式识别
图像与视频处理
机器学习
摘要
现代图像分类系统通常构建于深度神经网络之上,而深度神经网络易受对抗样本的攻击——即带有精心构造、难以察觉的噪声以误导网络分类的图像。为防御对抗样本,一个合理的思路是对输入图像关于网络的梯度进行混淆。这一总体思路启发了长串的防御方法。然而,它们几乎全都被证明是脆弱的。我们从一种截然不同的角度重新审视这一看似有缺陷的思路。我们接纳对抗样本的普遍存在以及构造它们的数值过程,并将这一有害的攻击过程转化为一种有用的防御机制。我们的防御方法在概念上很简单:在将输入图像送入分类之前,通过在预训练的外部模型上寻找一个对抗样本来对其进行变换。我们在多种可能的攻击下评估了我们的方法。在 CIFAR-10 和 Tiny ImageNet 数据集上,我们的方法都比最先进的方法显著更鲁棒。特别是,与对抗训练相比,我们的方法提供了更低的训练成本以及更强的鲁棒性。
引用
@article{arxiv.1911.11219,
title = {One Man's Trash is Another Man's Treasure: Resisting Adversarial Examples by Adversarial Examples},
author = {Chang Xiao and Changxi Zheng},
journal= {arXiv preprint arXiv:1911.11219},
year = {2019}
}