深度神经网络中相关神经元的状态能否作为检测对抗攻击的指标?
计算机视觉与模式识别
2020-11-02 v1 密码学与安全
机器学习
摘要
我们提出了一种基于检查稀疏神经元集合的对抗攻击检测方法。我们遵循如下假设:对抗攻击在输入中引入了难以察觉的扰动,且这些扰动改变了被攻击模型所建模概念的相关神经元的状态。因此,监控这些神经元的状态将能够检测对抗攻击。聚焦于图像分类任务,我们的方法识别出与模型所预测类别相关的神经元。对这些稀疏神经元集合的更深入定性检查表明,在存在对抗样本时它们的状态会发生变化。此外,我们实证评估的定量结果表明,我们的方法能够以与最先进(SOTA)检测器相当的准确率识别由最先进攻击方法生成的对抗样本。
引用
@article{arxiv.2010.15974,
title = {Can the state of relevant neurons in a deep neural networks serve as indicators for detecting adversarial attacks?},
author = {Roger Granda and Tinne Tuytelaars and Jose Oramas},
journal= {arXiv preprint arXiv:2010.15974},
year = {2020}
}