解释 AI 系统由数据驱动的决策:反事实方法
机器学习
2021-10-14 v5 人工智能
机器学习
摘要
我们考察用于解释基于模型的 AI 系统所做出决策的反事实解释。我们所考虑的反事实方法将解释定义为系统数据输入的一个集合,该集合因果地驱动决策(即,改变该集合中的输入会改变决策)且不可约简(即,改变其中任意子集均不改变决策)。我们(1)展示了该框架如何用于为通用的、数据驱动的 AI 系统决策提供解释,此类系统可包含具有任意数据类型的特征以及多个预测模型;(2)提出了一种启发式过程,以根据上下文寻找最有用的解释。随后,我们将反事实解释与通过按重要性加权特征来解释模型预测的方法(例如 SHAP、LIME)进行对比,并给出两个基本理由说明为何应仔细考量重要性加权解释是否适于解释系统决策。具体而言,我们表明(i)对模型预测具有较大重要性权重的特征可能并不影响相应决策,且(ii)重要性权重不足以传达特征是否及如何影响决策。我们通过若干简明示例以及三个详细案例研究对此进行演示,这些案例将反事实方法与 SHAP 进行比较,以阐明反事实解释在多种条件下比重要性权重更能解释数据驱动决策的情况。
引用
@article{arxiv.2001.07417,
title = {Explaining Data-Driven Decisions made by AI Systems: The Counterfactual Approach},
author = {Carlos Fernández-Loría and Foster Provost and Xintian Han},
journal= {arXiv preprint arXiv:2001.07417},
year = {2021}
}