中文

检测局部对抗样本:一种基于关键区域分析的通用方法

计算机视觉与模式识别 2021-02-16 v2

摘要

深度神经网络(DNNs)已广泛应用于人脸识别、图像分类等诸多领域;然而,它们易受对抗样本的攻击。通过添加少量难以察觉的扰动,攻击者便可轻易操纵 DNN 的输出。特别地,局部对抗样本仅扰动目标物体一小块连续区域,因而在数字与物理世界中均具有鲁棒性与有效性。尽管局部对抗样本比传统像素攻击具有更严重的现实影响,但现有文献尚未能很好地应对这一问题。本文提出一种称为 TaintRadar 的通用防御系统,通过分析被攻击者篡改的关键区域来精确检测局部对抗样本。其核心思想是:从输入图像中移除关键区域时,对抗标签的排序变化将大于良性标签的排序变化。与现有防御方案相比,TaintRadar 能有效捕获复杂的局部部分攻击(如眼镜攻击),且无需对原始模型结构进行额外训练或微调。我们在数字与物理世界中进行了全面实验,验证了该防御的有效性与鲁棒性。

关键词

引用

@article{arxiv.2102.05241,
  title  = {Detecting Localized Adversarial Examples: A Generic Approach using Critical Region Analysis},
  author = {Fengting Li and Xuankai Liu and Xiaoli Zhang and Qi Li and Kun Sun and Kang Li},
  journal= {arXiv preprint arXiv:2102.05241},
  year   = {2021}
}