中文

树模型特征重要性计算的改进:Shapley值与Banzhaf值之比较

机器学习 2021-08-10 v1

摘要

Shapley值是用于解释树集成模型预测的主要工具之一。Shapley值的主要替代方案是Banzhaf值,但后者尚未被同等深入地理解。在本文中,我们朝填补这一空白迈出一步,对这些模型解释方法提供实验与理论两方面的比较。令人惊讶的是,我们表明Banzhaf值在提供本质上相同的解释的同时,相较Shapley值具有若干优势。我们验证Banzhaf值:(1)具有更直观的解释,(2)允许更高效的算法,(3)数值上稳健得多。我们对这些论点进行了实验评估。特别地,我们在真实世界实例上展示了这一点。此外,从理论角度,我们提供新颖且改进的计算与Lundberg等人算法[Nat. Mach. Intell. 2020]相同Shapley值解释的方法。我们的算法运行时间为O(TLD+n)O(TLD+n),而先前算法的运行时间界为O(TLD2+n)O(TLD^2+n)。此处,TT为树的数量,LL为树中最大叶子数,DD表示集成中树的最大深度。利用为Shapley值开发的计算技术,我们给出计算Banzhaf值解释的优化O(TL+n)O(TL+n)时间算法。在我们的实验中,这些算法给出的运行时间甚至减少了一个数量级。

关键词

引用

@article{arxiv.2108.04126,
  title  = {Improved Feature Importance Computations for Tree Models: Shapley vs. Banzhaf},
  author = {Adam Karczmarz and Anish Mukherjee and Piotr Sankowski and Piotr Wygocki},
  journal= {arXiv preprint arXiv:2108.04126},
  year   = {2021}
}