中文

通过观测器网络非侵入式检测对抗性深度学习攻击

机器学习 2020-02-25 v1 密码学与安全 机器学习

摘要

近期研究表明,深度学习模型易受专门构造的、对人而言几乎难以察觉的对抗性输入所攻击。在本文中,我们提出一种检测对抗性输入的新方法,通过用多个二分类检测器(观测器网络)扩充主分类网络,这些检测器从原始网络的隐藏层(卷积核输出)获取输入,并将输入分类为干净或对抗性。在推理期间,检测器被视为集成网络的一部分,如果至少一半的检测器将其分类为对抗性,则该输入被视为对抗性。所提方法解决了在干净样本与对抗样本上分类精度之间的权衡,因为原始分类网络在检测过程中未被修改。多个观测器网络的使用使得即使攻击者知晓受害分类器,攻击检测机制也非平凡。我们在半白盒设置下使用快速梯度符号攻击(Fast Gradient Sign Attack),在MNIST数据集上实现了99.5%的检测准确率,在CIFAR-10数据集上实现了97.5%的检测准确率。在最坏情况下,误报检测率仅为0.12%。

关键词

引用

@article{arxiv.2002.09772,
  title  = {Non-Intrusive Detection of Adversarial Deep Learning Attacks via Observer Networks},
  author = {Kirthi Shankar Sivamani and Rajeev Sahay and Aly El Gamal},
  journal= {arXiv preprint arXiv:2002.09772},
  year   = {2020}
}

备注

5 pages, 2 figures, 4 tables