中文

基于 VAE 的无监督因果二元概念发现用于黑盒模型解释

机器学习 2021-09-13 v1

摘要

我们旨在以如下形式解释黑盒分类器:“数据 X 被分类为类别 Y 是因为 X \textit{具有} A、B 且 \textit{不具有} C”,其中 A、B 和 C 是高层概念。挑战在于我们必须以无监督方式发现一组对解释该分类器有用的概念,即 A、B 和 C。我们首先引入一个适合表达和发现此类概念的结构化生成模型。然后,我们提出一种学习过程,该过程同时学习数据分布并促使某些概念对分类器输出产生较大的因果影响。我们的方法还允许轻松整合用户的先验知识,以诱导概念的高可解释性。使用多个数据集,我们证明了我们的方法能够发现有用于解释的二元概念。

关键词

引用

@article{arxiv.2109.04518,
  title  = {Unsupervised Causal Binary Concepts Discovery with VAE for Black-box Model Explanation},
  author = {Thien Q. Tran and Kazuto Fukuchi and Youhei Akimoto and Jun Sakuma},
  journal= {arXiv preprint arXiv:2109.04518},
  year   = {2021}
}