解释消除:针对神经网络的对抗攻击识别
机器学习
2020-03-13 v1 密码学与安全
计算机视觉与模式识别
机器学习
摘要
我们研究了识别基于图像的神经网络所受对抗攻击的问题。我们展示了引人关注的实验结果,表明在干净数据与对抗数据上,模型预测所生成的解释之间存在显著差异。利用这一直觉,我们提出了一种框架,可基于模型给出的解释来识别给定输入是否为对抗样本。我们的实验代码可在此处找到:https://github.com/seansaito/Explaining-Away-Attacks-Against-Neural-Networks。
引用
@article{arxiv.2003.05748,
title = {Explaining Away Attacks Against Neural Networks},
author = {Sean Saito and Jin Wang},
journal= {arXiv preprint arXiv:2003.05748},
year = {2020}
}
备注
2 pages, 2 figures; Accepted at MLSys 2020 First Workshop on Secure and Resilient Autonomy