利用对抗扰动评估深度模型视觉解释的可靠性
机器学习
2020-04-24 v1 机器学习
摘要
计算机视觉应用中对复杂深度神经网络的兴趣日益增长。这导致需要提升这些模型的可解释能力。近期的解释方法呈现输入图像像素相关性的可视化,从而能够直接解释导致特定输出的输入属性。这些方法产生像素重要性图,通常通过视觉检查进行评估。这意味着解释方法的有效性是基于人类预期而非实际特征重要性来评判的。因此,本工作中我们提出一种客观度量来评估深度模型解释的可靠性。具体而言,我们的方法基于以对抗方式扰动输入图像所引起的网络输出变化。我们使用所提方法对广为人知的解释方法进行比较。最后,我们还提出将我们的方法直接应用于清理相关性图,在不损失关键解释(按我们所提度量)的前提下生成更具可解释性的图。
引用
@article{arxiv.2004.10824,
title = {Assessing the Reliability of Visual Explanations of Deep Models with Adversarial Perturbations},
author = {Dan Valle and Tiago Pimentel and Adriano Veloso},
journal= {arXiv preprint arXiv:2004.10824},
year = {2020}
}
备注
Accepted for publication at IJCNN 2020