中文

让柯基犬对蜂巢分类至关重要:基于概念的可解释性工具上的对抗攻击

机器学习 2022-07-27 v2 计算机视觉与模式识别

摘要

模型可解释性方法对于测试深度学习的公平性与健全性已变得愈发关键。基于概念的可解释性技术使用一小部分人类可解释的概念样本来衡量某一概念对模型输入内部表示的影响,是这一研究方向的重要分支。本工作表明,这些可解释性方法可能与其旨在分析的模型一样,易受对抗攻击。我们在两种知名的基于概念的可解释性方法TCAV和分面特征可视化上展示了该现象。我们表明,通过精心扰动所研究概念的示例,可彻底改变可解释性方法的输出。我们提出的攻击既能诱导正向解释(柯基犬花纹是模型分类斑马时的重要概念),也能诱导负向解释(条纹并非识别斑马图像的重要因素)。我们的工作强调,在安全关键应用中,不仅机器学习流水线需要安全保障,模型解释过程同样需要。

关键词

引用

@article{arxiv.2110.07120,
  title  = {Making Corgis Important for Honeycomb Classification: Adversarial Attacks on Concept-based Explainability Tools},
  author = {Davis Brown and Henry Kvinge},
  journal= {arXiv preprint arXiv:2110.07120},
  year   = {2022}
}

备注

AdvML Frontiers 2022 @ ICML 2022 workshop