中文

利用特征响应图追踪与检测 CNN 上的对抗攻击

计算机视觉与模式识别 2022-08-25 v1

摘要

卷积神经网络(CNN)上存在对抗攻击,令此类模型能否胜任严肃应用存疑。攻击者对输入图像加以操纵,诱使模型误分类,而在人眼看来仍显正常——因而难以检测。在另一背景下,CNN 隐藏层反向传播的激活——对给定输入的“特征响应”——有助于人类“调试者”可视化 CNN 在计算输出时“关注”什么。本工作中,我们提出一种针对对抗样本的崭新检测方法以防范攻击。我们通过追踪特征响应中的对抗扰动来实现,并借助平均局部空间熵完成自动检测。该方法不改变原网络架构,且完全可由人解释。实验在 ImageNet 上训练的大规模模型及最先进攻击下证实了本方法的有效性。

关键词

引用

@article{arxiv.2208.11436,
  title  = {Trace and Detect Adversarial Attacks on CNNs using Feature Response Maps},
  author = {Mohammadreza Amirian and Friedhelm Schwenker and Thilo Stadelmann},
  journal= {arXiv preprint arXiv:2208.11436},
  year   = {2022}
}

备注

13 pages, 6 figures