中文

“你的解释稳定吗?”:一种面向特征归因的鲁棒性评估框架

人工智能 2022-09-07 v1 计算机视觉与模式识别

摘要

理解神经网络的决策过程十分困难。一种重要的解释方法是将模型决策归因于关键特征。尽管已提出许多算法,但大多数仅致力于提升对模型的忠实度。然而,真实环境包含大量随机噪声,可能导致解释出现巨大波动。更严重的是,近期工作表明解释算法易受对抗攻击。这些都使得解释在真实场景中难以信赖。为弥补这一差距,我们提出了一种模型无关的方法“特征归因中位数检验”(MeTFA),以在理论保证下量化不确定性并增强解释算法的稳定性。MeTFA具有以下两项功能:(1)检验某特征是否显著重要或不重要,并生成MeTFA显著图以可视化结果;(2)计算特征归因分数的置信区间,并生成MeTFA平滑图以增强解释的稳定性。实验表明,MeTFA提升了解释的视觉质量,并在保持忠实度的同时显著降低了不稳定性。为定量评估不同噪声设置下解释的忠实度,我们进一步提出了若干鲁棒忠实度指标。实验结果显示,MeTFA平滑解释能显著提升鲁棒忠实度。此外,我们用两个场景展示了MeTFA的应用潜力。首先,当应用于SOTA解释方法为语义分割模型定位上下文偏置时,MeTFA显著解释仅用远小区域即可保持99%+的忠实度。其次,在面对不同面向解释的攻击测试时,MeTFA可帮助防御针对解释的普通及自适应对抗攻击。

关键词

引用

@article{arxiv.2209.01782,
  title  = {"Is your explanation stable?": A Robustness Evaluation Framework for Feature Attribution},
  author = {Yuyou Gan and Yuhao Mao and Xuhong Zhang and Shouling Ji and Yuwen Pu and Meng Han and Jianwei Yin and Ting Wang},
  journal= {arXiv preprint arXiv:2209.01782},
  year   = {2022}
}

备注

Accepted by ACM CCS 2022