中文

对抗鲁棒 CNN 的可解释性如何?

计算机视觉与模式识别 2023-06-06 v2 人工智能 人机交互

摘要

现有卷积神经网络(CNN)的三个重要准则是:(1)测试集准确率;(2)分布外准确率;(3)可解释性。尽管这些准则已被独立研究,它们之间的关系尚属未知。例如,具有更强分布外性能的 CNN 是否也具有更强的可解释性?此外,多数先前的特征重要性研究仅在 2-3 个常见的 vanilla ImageNet 训练 CNN 上评估方法,致使这些方法对其他架构与训练算法的 CNN 的泛化能力未知。在此,我们使用 9 种特征重要性方法与 12 个 ImageNet 训练的 CNN(涵盖 3 种训练算法与 5 种 CNN 架构)首次大规模评估这三准则的关系。我们为 ML 从业者找出若干重要见解与建议。第一,对抗鲁棒 CNN 在基于梯度的归因方法(而非基于 CAM 或基于扰动的方法)上具有更高的可解释性得分。第二,AdvProp 模型虽比单独的 vanilla 与鲁棒模型都更准确,但在可解释性上并不占优。第三,在测试的 9 种特征归因方法中,GradCAM 与 RISE 始终是最佳方法。第四,Insertion 与 Deletion 分别偏向 vanilla 与鲁棒模型,因其与 CNN 置信度得分分布强相关。第五,我们未发现有任一 CNN 在三项准则上均最佳,这有趣地暗示 CNN 随准确性提升而更难被解释。

关键词

引用

@article{arxiv.2205.13042,
  title  = {How explainable are adversarially-robust CNNs?},
  author = {Mehdi Nourelahi and Lars Kotthoff and Peijie Chen and Anh Nguyen},
  journal= {arXiv preprint arXiv:2205.13042},
  year   = {2023}
}