中文

恢复局部化对抗攻击

机器学习 2019-10-22 v1 机器学习

摘要

深度卷积神经网络近年来取得了巨大成功,尤其在计算机视觉领域。它们快速、便捷,并且得益于成熟的框架,相对易于实现与部署。然而,尽管已有若干旨在为神经网络预测提供人类可理解解释的方法被提出,其推理过程仍隐藏于黑箱之中。对于这些解释器中哪些最适合何种情境,以及如何定量评估与比较它们,目前仍存在争议。在本文中,我们关注卷积深度神经网络解释器在一种极端情境下的能力:人类与网络根本分歧的设定。深度神经网络易受对抗攻击的影响,此类攻击蓄意修改输入样本以误导网络分类,同时不影响人类观察者对该输入的理解。本文的目标是通过考察解释器能否识别图像中被对抗攻击的区域,来评估它们。具体而言,我们定量与定性地研究了三种流行的分类解释器——经典显著图、引导反向传播与 LIME——在代表性图像分类示例中,将攻击区域识别为(错误)预测的解释区域的能力。我们发现 LIME 优于其他解释器。

关键词

引用

@article{arxiv.1910.09239,
  title  = {Recovering Localized Adversarial Attacks},
  author = {Jan Philip Göpfert and Heiko Wersing and Barbara Hammer},
  journal= {arXiv preprint arXiv:1910.09239},
  year   = {2019}
}