论基于树的模型的边际特征归因
机器学习
2024-05-09 v4 计算机科学与博弈论
摘要
由于其性能强大且易于使用,基于树的机器学习模型(如随机森林和梯度提升树集成)已变得非常流行。为解释它们,可采用基于边际期望的局部特征归因,例如边际(干预式)Shapley、Owen或Banzhaf值。此类方法忠实于模型且与实现无关,即仅依赖于模型的输入-输出函数。我们通过给出两棵(统计上相似)决策树,它们计算出完全相同的函数,但“路径依赖”的TreeSHAP给出不同的特征排序,而边际Shapley值一致,从而将这与流行的TreeSHAP算法进行对比。此外,我们讨论了如何利用基于树的模型的内部结构,依据线性博弈值计算其边际特征归因。一个重要的观察是,相对于由训练模型确定的输入空间的某种网格划分,这些是简单的(分段常数)函数。另一个关键观察通过XGBoost、LightGBM和CatBoost库的试验展示:集成中并非所有特征都出现在某棵树上。因此,计算边际Shapley(或Owen或Banzhaf)特征归因的复杂度可降低。这对于我们将以公理化刻画的更广泛的博弈值类依然成立。一个典型例子是CatBoost模型,其中树是 oblivious(对称)的,且每棵树中特征数不大于其深度。我们利用对称性推导出一个显式公式,具有更优复杂度且仅依赖于内部模型参数,用于CatBoost模型的边际Shapley(以及Banzhaf和Owen)值。这产生了一种快速、准确的估计这些特征归因的算法。
引用
@article{arxiv.2302.08434,
title = {On marginal feature attributions of tree-based models},
author = {Khashayar Filom and Alexey Miroshnikov and Konstandinos Kotsiopoulos and Arjun Ravi Kannan},
journal= {arXiv preprint arXiv:2302.08434},
year = {2024}
}
备注
Minor corrections. 30 pages+appendix (64 pages in total), 10 figures. To appear in Foundations of Data Science