中文

深度神经网络中相关神经元的状态能否作为检测对抗攻击的指标?

计算机视觉与模式识别 2020-11-02 v1 密码学与安全 机器学习

摘要

我们提出了一种基于检查稀疏神经元集合的对抗攻击检测方法。我们遵循如下假设:对抗攻击在输入中引入了难以察觉的扰动,且这些扰动改变了被攻击模型所建模概念的相关神经元的状态。因此,监控这些神经元的状态将能够检测对抗攻击。聚焦于图像分类任务,我们的方法识别出与模型所预测类别相关的神经元。对这些稀疏神经元集合的更深入定性检查表明,在存在对抗样本时它们的状态会发生变化。此外,我们实证评估的定量结果表明,我们的方法能够以与最先进(SOTA)检测器相当的准确率识别由最先进攻击方法生成的对抗样本。

关键词

引用

@article{arxiv.2010.15974,
  title  = {Can the state of relevant neurons in a deep neural networks serve as indicators for detecting adversarial attacks?},
  author = {Roger Granda and Tinne Tuytelaars and Jose Oramas},
  journal= {arXiv preprint arXiv:2010.15974},
  year   = {2020}
}