PixelDefend:利用生成模型理解与防御对抗样本
机器学习
2018-05-22 v3
摘要
正常图像的对抗扰动通常对人类不可感知,但它们会严重混淆最先进的机器学习模型。是什么使它们在图像分类器眼中如此特殊?在本文中,我们通过实验表明,无论攻击类型和目标模型如何,对抗样本主要位于训练分布的低概率区域。利用统计假设检验,我们发现现代神经密度模型在检测不可感知的图像扰动方面出奇地好。基于这一发现,我们设计了 PixelDefend,一种通过将恶意扰动图像移回训练数据中见过的分布来净化该图像的新方法。随后将净化后的图像送入未修改的分类器,使我们的方法对分类器和攻击方法均无关。因此,PixelDefend 可用于保护已部署的模型,并与其他针对特定模型的防御结合使用。实验表明,我们的方法在多种最先进攻击方法下大幅提升了鲁棒性,将最强攻击下 Fashion MNIST 的准确率从 63% 提高到 84%,CIFAR-10 从 32% 提高到 70%。
引用
@article{arxiv.1710.10766,
title = {PixelDefend: Leveraging Generative Models to Understand and Defend against Adversarial Examples},
author = {Yang Song and Taesup Kim and Sebastian Nowozin and Stefano Ermon and Nate Kushman},
journal= {arXiv preprint arXiv:1710.10766},
year = {2018}
}
备注
ICLR 2018