攻击遇上可解释性:基于属性引导的对抗样本检测
机器学习
2018-10-30 v1 人工智能
密码学与安全
机器学习
摘要
对抗样本攻击通过扰动良性输入来诱导 DNN 误判。近期研究已表明此类攻击的广泛存在及其破坏性后果。现有防御技术要么假设已知特定攻击的先验知识,要么因其底层假设而在复杂模型上表现不佳。我们认为对抗样本攻击与 DNN 模型的可解释性深度纠缠:良性输入上的分类结果可基于人类可感知的特征/属性进行推理,而对抗样本上的结果则难以解释。因此,我们提出了一种基于可解释性的、面向人脸识别模型的新型对抗样本检测技术。其特点是在属性与内部神经元之间进行新颖的双向对应推断,以识别对个体属性至关重要的神经元。关键神经元的激活值被增强以放大计算的可推理部分,而其他神经元的值被削弱以抑制不可解释部分。经此变换后的分类结果与原模型的结果进行比较以检测对抗样本。结果表明,我们的技术对 7 种不同攻击可实现 94% 的检测准确率,且良性输入的误报率为 9.91%。相比之下,最先进(state-of-the-art)的特征压缩技术仅能达到 55% 的准确率与 23.3% 的误报率。
引用
@article{arxiv.1810.11580,
title = {Attacks Meet Interpretability: Attribute-steered Detection of Adversarial Samples},
author = {Guanhong Tao and Shiqing Ma and Yingqi Liu and Xiangyu Zhang},
journal= {arXiv preprint arXiv:1810.11580},
year = {2018}
}
备注
Accepted to NIPS 2018 Spotlight