中文

概念激活区域:基于概念的解释的广义框架

机器学习 2022-09-30 v2 人工智能

摘要

基于概念的解释允许用户通过指定的概念来理解深度神经网络(DNN)的预测。现有方法假设,阐释某概念的示例被映射到 DNN 潜空间的固定方向。当此成立时,该概念可由指向该方向的概念激活向量(CAV)表示。在本文中,我们提出放宽该假设,允许概念示例散布于 DNN 潜空间中的不同簇。每个概念随后由包含这些簇的 DNN 潜空间区域表示,我们称之为概念激活区域(CAR)。为形式化该思想,我们引入了基于核技巧与支持向量分类器的 CAV 形式体系的扩展。该 CAR 形式体系产生全局基于概念的解释与局部基于概念的特征重要性。我们证明,用径向核构建的 CAR 解释在潜空间等距变换下不变。如此,CAR 对具有相同几何的潜空间赋予相同解释。我们进一步通过实证表明,CAR 提供(1)对概念如何散布于 DNN 潜空间更精确的描述;(2)更贴近人类概念标注的全局解释;(3)有意义地关联概念彼此的基于概念的特征重要性。最后,我们用 CAR 表明 DNN 能自主重新发现已知科学概念,例如前列腺癌分级系统。

关键词

引用

@article{arxiv.2209.11222,
  title  = {Concept Activation Regions: A Generalized Framework For Concept-Based Explanations},
  author = {Jonathan Crabbé and Mihaela van der Schaar},
  journal= {arXiv preprint arXiv:2209.11222},
  year   = {2022}
}

备注

Presented at NeurIPS 2022