解释博弈:使用 Shapley 值解释机器学习模型
机器学习
2020-06-29 v3 人工智能
机器学习
摘要
已有许多技术被提出,通过将机器学习模型的预测归因于相应的输入特征来解释该预测。其中流行的是应用合作博弈论中的 Shapley 值方法的技术。现有论文聚焦于 Shapley 值的公理化动机以及计算它们的高效技术,却很少对其所用博弈表述提供 justification,也未解决其方法输出中隐含的不确定性。例如,流行的 SHAP 算法的表述可能将 substantial 归因赋予在模型中不起作用的特征。在这项工作中,我们阐明现有方法的底层博弈表述中的细微差异如何导致对同一预测归因的巨大差异。然后我们提出一个统一的现有方法的通用博弈表述,并能够对其归因给出直接的置信区间。此外,它使我们能够将归因解释为相对于参考输入分布的输入的反事实解释。我们将这一思想与认知心理学中关于反事实解释的经典研究相联系,并提出一个用于生成和解释 ML 模型解释的概念框架,称为 formulate、approximate、explain (FAE)。我们将该框架应用于解释在 two UCI 数据集和 a Lending Club 数据集上训练的黑盒模型。
引用
@article{arxiv.1909.08128,
title = {The Explanation Game: Explaining Machine Learning Models Using Shapley Values},
author = {Luke Merrick and Ankur Taly},
journal= {arXiv preprint arXiv:1909.08128},
year = {2020}
}