针对通用对抗扰动的防御
计算机视觉与模式识别
2018-03-01 v3
摘要
深度学习的近期进展表明,存在与图像无关的、准不可感知的扰动,当应用于“任何”图像时,可欺骗最先进的网络分类器改变其对图像标签的预测。这些“通用对抗扰动”对深度学习在实践中的成功构成严重威胁。我们提出首个专用框架,以有效防御网络免受此类扰动攻击。我们的方法学习一个扰动校正网络(PRN)作为目标模型的“输入前”层,从而无需修改目标模型。PRN 从真实与合成的与图像无关的扰动中学习,其中还提出了一种计算后者的高效方法。一个扰动检测器在 PRN 输入输出差的离散余弦变换上单独训练。查询图像首先通过 PRN 并由检测器验证。若检测到扰动,则使用 PRN 的输出而非实际图像进行标签预测。严格的评估表明,我们的框架在真实场景中以高达 97.5% 的成功率防御网络分类器抵御未见过的对抗扰动。PRN 也具有很好的泛化性:为一个目标网络训练可防御另一个网络且成功率相当。
引用
@article{arxiv.1711.05929,
title = {Defense against Universal Adversarial Perturbations},
author = {Naveed Akhtar and Jian Liu and Ajmal Mian},
journal= {arXiv preprint arXiv:1711.05929},
year = {2018}
}
备注
Accepted in IEEE CVPR 2018