通过对抗式模型操纵愚弄神经网络解释方法
机器学习
2019-11-04 v3 人工智能
计算机视觉与模式识别
机器学习
摘要
我们探讨神经网络解释方法是否可通过对抗式模型操纵被愚弄,后者定义为一种模型微调步骤,旨在根本改变解释而不损害原始模型(如 VGG19、ResNet50 和 DenseNet121)的精度。通过将解释结果直接纳入微调目标函数的惩罚项中,我们表明最先进的基于显著图的解释器(如 LRP、Grad-CAM 和 SimpleGrad)可轻易被我们的模型操纵愚弄。我们提出两类愚弄方式:被动与主动,并证明此类愚弄对整体验证集泛化良好,且可迁移至其他解释方法。我们的结果既通过可视化展示被愚弄的解释,也通过报告衡量偏离原始解释程度的定量指标加以验证。我们主张,神经网络解释方法相对于我们的对抗式模型操纵的稳定性,是开发稳健可靠神经网络解释方法所需检验的重要准则。
引用
@article{arxiv.1902.02041,
title = {Fooling Neural Network Interpretations via Adversarial Model Manipulation},
author = {Juyeon Heo and Sunghwan Joo and Taesup Moon},
journal= {arXiv preprint arXiv:1902.02041},
year = {2019}
}