基于高层表示引导去噪器的对抗攻击防御
计算机视觉与模式识别
2018-05-09 v2
摘要
神经网络易受对抗样本的攻击,这对其在安全敏感系统中的应用构成威胁。我们提出高层表示引导去噪器(HGD)作为图像分类的一种防御手段。标准去噪器存在误差放大效应,即微小的残差对抗噪声被逐步放大并导致错误分类。HGD通过使用以干净图像与去噪图像在目标模型上激活输出之间的差异定义的损失函数克服了该问题。与大规模图像上最先进的防御方法集成对抗训练相比,HGD具有三个优势。第一,以HGD作为防御时,目标模型对白盒或黑盒对抗攻击都更具鲁棒性。第二,HGD可在小规模图像子集上训练,并能很好地泛化到其他图像和未见过类别。第三,HGD可迁移用于防御除引导它的模型之外的其他模型。在NIPS对抗攻击防御竞赛中,我们的HGD方案获得第一名,并以较大优势超越其他模型。
引用
@article{arxiv.1712.02976,
title = {Defense against Adversarial Attacks Using High-Level Representation Guided Denoiser},
author = {Fangzhou Liao and Ming Liang and Yinpeng Dong and Tianyu Pang and Xiaolin Hu and Jun Zhu},
journal= {arXiv preprint arXiv:1712.02976},
year = {2018}
}