使用 Shapley 值进行模型解释的预测与因果含义
机器学习
2020-08-13 v1 统计理论
机器学习
统计理论
摘要
Shapley 值是博弈论中的一个概念。近年来,它已被用于解释机器学习技术生成的复杂模型。尽管 Shapley 值的数学定义直截了当,但将其用作模型解释工具的含义尚待阐明。在本文中,我们在贝叶斯网络框架下分析了 Shapley 值。我们建立了 Shapley 值与条件独立性之间的关系,而条件独立性是预测建模与因果建模中的关键概念。我们的结果表明,从模型中剔除具有高 Shapley 值的变量未必会损害预测性能,而从模型中剔除具有低 Shapley 值的变量则可能损害性能。因此,在一般情况下,使用 Shapley 值进行特征选择并不会得到最简洁且预测最优的模型。更重要的是,变量的 Shapley 值并不反映它们与感兴趣目标之间的因果关系。
引用
@article{arxiv.2008.05052,
title = {Predictive and Causal Implications of using Shapley Value for Model Interpretation},
author = {Sisi Ma and Roshan Tourani},
journal= {arXiv preprint arXiv:2008.05052},
year = {2020}
}
备注
Accepted by KDD CD workshop 2020