MAIRE——一种用于解释分类器的模型无关可解释规则提取方法
人工智能
2020-11-04 v1 机器学习
摘要
本文提出一种新颖框架,用于提取模型无关且人类可解释的规则,以解释分类器的输出。人类可解释规则被定义为包含待解释分类决策实例的轴对齐超立方体。所提方法寻找最大的(高 \textit{coverage})轴对齐超立方体,使得其中高比例的实例与所解释实例具有相同类标签(高 \textit{precision})。定义了以超立方体参数表示的 coverage 与 precision 度量的新颖近似,并利用基于梯度的优化器对其最大化。从理论上与实验上严格分析了近似的质量。还提出了用于简化生成解释以提升可解释性的启发式方法,以及一种贪心选择算法,将局部解释组合为覆盖实例空间大部的模型全局解释。该框架模型无关,可应用于任意分类器及所有类型属性(包括连续、有序与无序离散)。通过在来自不同领域(表格、文本与图像)的多种合成与真实数据集上的验证,表明了该框架的广泛适用性。
引用
@article{arxiv.2011.01506,
title = {MAIRE -- A Model-Agnostic Interpretable Rule Extraction Procedure for Explaining Classifiers},
author = {Rajat Sharma and Nikhil Reddy and Vidhya Kamakshi and Narayanan C Krishnan and Shweta Jain},
journal= {arXiv preprint arXiv:2011.01506},
year = {2020}
}