通过选择性特征再生抵御通用攻击
计算机视觉与模式识别
2020-08-18 v4
摘要
深度神经网络(DNN)的预测已被证明易受精心构造的对抗扰动的影响。具体而言,添加到任意图像上的图像无关(通用对抗)扰动可欺骗目标网络做出错误预测。不同于主要在图像域起效的现有防御策略,我们提出一种在 DNN 特征域中运作并有效防御此类通用扰动的新防御方法。我们的方法识别最容易受对抗噪声影响的预训练卷积特征,并部署可训练的特征再生单元,将这些 DNN 滤波器激活转换为对通用扰动鲁健的特征。仅再生最多 6 个 DNN 层中前 50% 最易受对抗影响的激活,而保持其余所有 DNN 激活不变,我们在恢复精度上以超过 10% 的优势优于不同网络架构下的现有防御策略。我们表明,无需任何额外修改,我们在 ImageNet 上以一种通用攻击样本训练的防御能有效抵御其他类型的未见通用攻击。
引用
@article{arxiv.1906.03444,
title = {Defending Against Universal Attacks Through Selective Feature Regeneration},
author = {Tejas Borkar and Felix Heide and Lina Karam},
journal= {arXiv preprint arXiv:1906.03444},
year = {2020}
}
备注
CVPR 2020. Code: https://github.com/tsborkar/Selective-feature-regeneration Webpage: https://www.cs.princeton.edu/~fheide/SelectiveFeatureRegeneration/