树模型特征重要性计算的改进:Shapley值与Banzhaf值之比较
机器学习
2021-08-10 v1
摘要
Shapley值是用于解释树集成模型预测的主要工具之一。Shapley值的主要替代方案是Banzhaf值,但后者尚未被同等深入地理解。在本文中,我们朝填补这一空白迈出一步,对这些模型解释方法提供实验与理论两方面的比较。令人惊讶的是,我们表明Banzhaf值在提供本质上相同的解释的同时,相较Shapley值具有若干优势。我们验证Banzhaf值:(1)具有更直观的解释,(2)允许更高效的算法,(3)数值上稳健得多。我们对这些论点进行了实验评估。特别地,我们在真实世界实例上展示了这一点。此外,从理论角度,我们提供新颖且改进的计算与Lundberg等人算法[Nat. Mach. Intell. 2020]相同Shapley值解释的方法。我们的算法运行时间为,而先前算法的运行时间界为。此处,为树的数量,为树中最大叶子数,表示集成中树的最大深度。利用为Shapley值开发的计算技术,我们给出计算Banzhaf值解释的优化时间算法。在我们的实验中,这些算法给出的运行时间甚至减少了一个数量级。
引用
@article{arxiv.2108.04126,
title = {Improved Feature Importance Computations for Tree Models: Shapley vs. Banzhaf},
author = {Adam Karczmarz and Anish Mukherjee and Piotr Sankowski and Piotr Wygocki},
journal= {arXiv preprint arXiv:2108.04126},
year = {2021}
}