面向树集成模型的一致个性化特征归因方法
机器学习
2019-03-08 v3 机器学习
摘要
解释梯度提升机和随机森林等树集成方法的预测十分重要,然而针对树的特征归因往往是启发式的,且未针对每次预测进行个性化。本文指出,流行的特征归因方法是不一致的,即当一个特征的真实影响实际增加时,其被分配的重要性反而可能降低。这是一个根本性问题,使任何特征间的比较都受到质疑。为此,我们借助博弈论的最新应用,开发了用于计算 SHAP(SHapley Additive exPlanation,沙普利加性解释)值的快速精确树求解方法,SHAP 值是唯一一致且局部准确的归因值。我们进一步将 SHAP 值扩展到交互效应,并定义了 SHAP 交互值。我们提出了一种丰富的个性化特征归因可视化方法,优于经典的归因摘要与偏依赖图,以及一种独特的“有监督”聚类(基于特征归因的聚类)。我们通过用户研究展示了更好的人类直觉一致性、运行时间的指数级提升、改进的聚类性能,以及对有影响力特征的更好识别。我们的算法实现已合并入 XGBoost 和 LightGBM,详见 http://github.com/slundberg/shap。
引用
@article{arxiv.1802.03888,
title = {Consistent Individualized Feature Attribution for Tree Ensembles},
author = {Scott M. Lundberg and Gabriel G. Erion and Su-In Lee},
journal= {arXiv preprint arXiv:1802.03888},
year = {2019}
}
备注
Follow-up to 2017 ICML Workshop arXiv:1706.06060