中文

用于解释对抗攻击的显著性方法

计算机视觉与模式识别 2019-10-22 v4

摘要

神经网络的分类决策可能被微小的不可察觉扰动所误导。本工作旨在使用显著性方法解释这些被误导的分类。显著性方法背后的思想是通过创建所谓的显著性图来解释神经网络的分类决策。不幸的是,近期一些出版物表明,许多提出的显著性方法并未提供有洞察力的解释。一个突出的例子是导向反向传播(GuidedBP),它仅仅执行(部分)图像恢复。然而,我们的数值分析显示,由GuidedBP创建的显著性图确实包含类别判别信息。我们提出了一种简单而高效的方法来增强显著性图。所提出的增强型GuidedBP在解释对抗分类方面展示了最先进的性能。

关键词

引用

@article{arxiv.1908.08413,
  title  = {Saliency Methods for Explaining Adversarial Attacks},
  author = {Jindong Gu and Volker Tresp},
  journal= {arXiv preprint arXiv:1908.08413},
  year   = {2019}
}