中文

SAD:基于显著性的对抗样本防御方法

计算机视觉与模式识别 2020-03-11 v1

摘要

随着机器与深度学习模型 popularity 的上升,人们越来越关注它们对恶意输入的脆弱性。这些对抗样本使模型预测偏离网络的原始意图,并且在实际安全中日益成为关切。为了对抗这些攻击,神经网络可利用传统图像处理方法或最先进的防御模型来减少数据中的扰动。采取全局噪声削减的防御方法对对抗攻击有效,然而其有损方法常会扭曲图像中的重要数据。在这项工作中,我们提出一种基于视觉显著性的方法来清理受对抗攻击影响的数据。我们的模型利用对抗图像的显著区域以提供有针对性的对策,同时在清理后的图像中相对减少损失。我们通过评估最先进显著性方法在攻击前、攻击下以及应用清理方法后的有效性来衡量我们模型的准确性。我们在两个显著性数据集上,针对已建立的对抗攻击方法,展示了我们提出的方法相较于相关防御方法的的有效性。与传统的和最先进的方法相比,我们的有针对性方法在一系列标准统计与距离显著性度量上显示出显著改进。

关键词

引用

@article{arxiv.2003.04820,
  title  = {SAD: Saliency-based Defenses Against Adversarial Examples},
  author = {Richard Tran and David Patrick and Michael Geyer and Amanda Fernandez},
  journal= {arXiv preprint arXiv:2003.04820},
  year   = {2020}
}

备注

9 pages