使用置信项集对黑盒分类器进行事后解释
人工智能
2020-09-22 v2 机器学习
摘要
黑盒人工智能(AI)方法,例如深度神经网络,已被广泛用于构建能够提取数据集中复杂关系并对新的未见数据记录进行预测的预测模型。然而,由于这些方法的内部运作和决策逻辑对用户隐藏,因此很难信任它们做出的决策。可解释人工智能(XAI)指的是试图解释黑盒 AI 模型如何产生其结果的系统。事后 XAI 方法通过提取特征值与预测之间的关系来近似黑盒的行为。基于扰动的方法和决策集方法是常用的事后 XAI 系统。前者依赖于对数据记录进行随机扰动来构建局部或全局线性模型,以解释单个预测或整个模型。后者则使用那些出现频率更高的特征值来构建一组决策规则,这些规则产生与目标黑盒相同的结果。然而,这两类 XAI 方法都有一些局限性。随机扰动没有考虑不同子空间中特征值的分布,导致误导性的近似。决策集只关注频繁出现的特征值,而错过了许多特征与类标签之间的重要相关性,这些相关性虽然出现频率较低,但能准确表示模型的决策边界。在本文中,我们通过提出一种名为置信项集解释(CIE)的解释方法来应对上述挑战。我们引入了置信项集,这是一组与特定类别标签高度相关的特征值。CIE 利用置信项集将模型的整个决策空间离散化为更小的子空间。
引用
@article{arxiv.2005.01992,
title = {Post-hoc explanation of black-box classifiers using confident itemsets},
author = {Milad Moradi and Matthias Samwald},
journal= {arXiv preprint arXiv:2005.01992},
year = {2020}
}