中文

解释消除:针对神经网络的对抗攻击识别

机器学习 2020-03-13 v1 密码学与安全 计算机视觉与模式识别 机器学习

摘要

我们研究了识别基于图像的神经网络所受对抗攻击的问题。我们展示了引人关注的实验结果,表明在干净数据与对抗数据上,模型预测所生成的解释之间存在显著差异。利用这一直觉,我们提出了一种框架,可基于模型给出的解释来识别给定输入是否为对抗样本。我们的实验代码可在此处找到:https://github.com/seansaito/Explaining-Away-Attacks-Against-Neural-Networks。

关键词

引用

@article{arxiv.2003.05748,
  title  = {Explaining Away Attacks Against Neural Networks},
  author = {Sean Saito and Jin Wang},
  journal= {arXiv preprint arXiv:2003.05748},
  year   = {2020}
}

备注

2 pages, 2 figures; Accepted at MLSys 2020 First Workshop on Secure and Resilient Autonomy