中文

如何操纵 CNN 使其说谎:以 GradCAM 为例

计算机视觉与模式识别 2019-08-19 v2 密码学与安全 机器学习

摘要

近年来出现了许多解释 CNN 决策的方法。然而,已有研究表明某些方法对输入的操纵十分敏感。我们延续这一研究方向,考察解释方法 GradCAM。与操纵输入不同,我们考虑一个操纵模型本身以攻击解释的对手。通过改变权重和架构,我们证明可以在保持模型准确率基本不变的情况下生成任意期望的解释。这说明 GradCAM 无法解释每一个 CNN 的决策,并提供了一个概念验证,表明混淆 CNN 内部工作机制是可能的。最后,我们结合输入与模型的操纵。为此,我们在网络中植入了一个后门:除非输入中存在特定模式触发恶意解释,否则解释是正确的。我们的工作引发了新的安全担忧,特别是在模型解释可能被用于决策的场景中,例如医疗领域。

关键词

引用

@article{arxiv.1907.10901,
  title  = {How to Manipulate CNNs to Make Them Lie: the GradCAM Case},
  author = {Tom Viering and Ziqi Wang and Marco Loog and Elmar Eisemann},
  journal= {arXiv preprint arXiv:1907.10901},
  year   = {2019}
}

备注

Presented at BMVC 2019: Workshop on Interpretable and Explainable Machine Vision, Cardiff, UK. Updated to BMVC template