热与模糊:一种针对对抗样本的有效且快速的防御方法
计算机视觉与模式识别
2020-03-18 v1 机器学习
神经与进化计算
摘要
人工神经网络(NNs)越来越多地融入诸多领域,尤其是生命关键系统,但其对对抗样本(AEs)的脆弱性制约了这种应用。一些现有防御方法可提升 NNs 的鲁棒性,但它们常需特殊架构或训练流程,且不适用于已训练模型。在本文中,我们提出一种结合特征可视化与输入修改的简单防御,因此可应用于各种预训练网络。通过回顾若干可解释性方法,我们获得关于 AEs 对 NNs 计算影响的新见解。基于此,我们假设即便输入为对抗样本,“真实”物体的信息仍保留在 NN 的激活中,并给出一种特征可视化版本,能以相关性热图形式提取该信息。随后我们以这些热图为基础构建防御,通过大规模模糊破坏对抗效应。我们还提出一种新评估指标,能更完整、更具描述性地刻画攻击与防御的效果,并利用 VGG19 在 ImageNet 数据集上的结果证明了该防御的有效性及所提评估度量的效用。
引用
@article{arxiv.2003.07573,
title = {Heat and Blur: An Effective and Fast Defense Against Adversarial Examples},
author = {Haya Brama and Tal Grinshpoun},
journal= {arXiv preprint arXiv:2003.07573},
year = {2020}
}
备注
Submitted to IJCAI 2020 conference