树集成的 consistent feature attribution for tree ensembles
人工智能
2018-02-20 v6 机器学习
机器学习
摘要
请注意,本文的一个更新的扩展版本现已可在 arXiv:1802.03888 获取。在许多应用中,理解哪些特征对模型很重要以及为何做出个别预测是至关重要的。对于树集成方法,这些问题通常通过将重要性值归因于输入特征来回答,可以是全局的或针对单个预测的。在此我们表明,当前的特征归因方法是不一致的,这意味着改变模型使其更依赖于给定特征,实际上可能会降低分配给该特征的重要性。为了解决这个问题,我们开发了 SHAP (SHapley Additive exPlanation) 值的快速精确解,最近证明这是基于条件期望的唯一一致且局部准确的加性特征归因方法。我们将这些改进集成到最新版本的 XGBoost 中,展示了当前方法的不一致性,并表明使用 SHAP 值可显著提升监督聚类性能。特征重要性值是理解梯度提升树和随机森林等广泛使用模型的关键部分,因此对其进行改进具有广泛的实际意义。
引用
@article{arxiv.1706.06060,
title = {Consistent feature attribution for tree ensembles},
author = {Scott M. Lundberg and Su-In Lee},
journal= {arXiv preprint arXiv:1706.06060},
year = {2018}
}
备注
presented at 2017 ICML Workshop on Human Interpretability in Machine Learning (WHI 2017), Sydney, NSW, Australia