中文

groupShapley:基于特征组Shapley值的高效预测解释方法

机器学习 2021-06-24 v1 机器学习

摘要

Shapley值已成为解释复杂机器学习模型预测最为恰当且理论严谨的框架之一。Shapley值在解释场景中的流行可能源于其独特的理论性质。然而,Shapley值的主要缺陷在于其计算复杂度随输入特征数量呈指数增长,这在许多具有数百或数千特征的实际情形中难以可行。此外,面对众多(相关)特征时,对已计算的Shapley值进行呈现、可视化与解释也颇具挑战。本文提出groupShapley:一种概念上简单以应对上述瓶颈的方法。其思路是将特征分组(例如按类型或依赖性),然后针对这些组而非所有单个特征计算并呈现Shapley值。将数百或数千特征缩减至约半打,使精确计算在实际中可行,并极大简化了呈现与知识提取。我们证明在特定条件下,groupShapley等价于对每个特征组内逐特征Shapley值求和。此外,我们提供了模拟研究以阐明当这些条件不满足时的差异。我们通过一个真实世界的汽车保险案例展示了该方法的可用性,其中groupShapley被用于提供简单直观的解释。

关键词

引用

@article{arxiv.2106.12228,
  title  = {groupShapley: Efficient prediction explanation with Shapley values for feature groups},
  author = {Martin Jullum and Annabelle Redelmeier and Kjersti Aas},
  journal= {arXiv preprint arXiv:2106.12228},
  year   = {2021}
}