中文

用于模型解释的对抗不忠实学习

机器学习 2020-08-04 v3 机器学习

摘要

模型解释在数据挖掘与知识发现中至关重要。它有助于理解模型内在工作机制并检验模型是否具有不良特性。执行模型解释的一种流行方式是实例级特征选择(IFS),其为表示数据样本的每个特征提供重要性分数,以解释模型如何生成特定输出。本文提出一种模型无关、有效、高效、直接(MEED)的IFS框架用于模型解释,缓解关于合理性、组合捷径、模型可辨识性和信息传输的担忧。此外,我们关注如下设定:使用所选特征直接预测给定模型的输出,其作为模型解释方法的一项主要评价指标。除特征外,我们将给定模型的输出作为附加输入,以基于更准确的信息学习解释器。为学习解释器,除忠实性外,我们提出对抗不忠实学习(AIL)机制,通过筛选相对不重要的特征来促进解释学习。通过理论与实验分析,我们表明我们的AIL机制可帮助学习所选特征与目标之间所需的条件分布。此外,我们通过集成高效解释方法作为恰当先验以提供热启动来扩展我们的框架。我们提供了由定量指标和人工评估构成的综合实证评估结果,以证明所提方法的有效性与优越性。我们的代码公开于 https://github.com/langlrsw/MEED。

关键词

引用

@article{arxiv.2006.05379,
  title  = {Adversarial Infidelity Learning for Model Interpretation},
  author = {Jian Liang and Bing Bai and Yuren Cao and Kun Bai and Fei Wang},
  journal= {arXiv preprint arXiv:2006.05379},
  year   = {2020}
}

备注

26th ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD '20), August 23--27, 2020, Virtual Event, USA