中文

通过对抗式模型操纵愚弄神经网络解释方法

机器学习 2019-11-04 v3 人工智能 计算机视觉与模式识别 机器学习

摘要

我们探讨神经网络解释方法是否可通过对抗式模型操纵被愚弄,后者定义为一种模型微调步骤,旨在根本改变解释而不损害原始模型(如 VGG19、ResNet50 和 DenseNet121)的精度。通过将解释结果直接纳入微调目标函数的惩罚项中,我们表明最先进的基于显著图的解释器(如 LRP、Grad-CAM 和 SimpleGrad)可轻易被我们的模型操纵愚弄。我们提出两类愚弄方式:被动与主动,并证明此类愚弄对整体验证集泛化良好,且可迁移至其他解释方法。我们的结果既通过可视化展示被愚弄的解释,也通过报告衡量偏离原始解释程度的定量指标加以验证。我们主张,神经网络解释方法相对于我们的对抗式模型操纵的稳定性,是开发稳健可靠神经网络解释方法所需检验的重要准则。

关键词

引用

@article{arxiv.1902.02041,
  title  = {Fooling Neural Network Interpretations via Adversarial Model Manipulation},
  author = {Juyeon Heo and Sunghwan Joo and Taesup Moon},
  journal= {arXiv preprint arXiv:1902.02041},
  year   = {2019}
}