中文

InstaSHAP:瞬时解释性可加模型解释 Shapley 值

机器学习 2025-02-21 v1 机器学习

摘要

近年来,Shapley 值和 SHAP 解释已成为提供黑箱模型后置解释的最主导范式之一。尽管它们拥有良好的理论属性,但近期许多研究聚焦于它们在计算效率和表示能力方面的局限性。然而,与可加模型之间的内在联系在当前文献中却严重被低估。在本工作中,我们发现,将 GAM 模型与 SHAP 解释建立变分视角的联系,能够为几乎所有近期发展提供深入见解。基于这一联系,我们反向借用,发展出一种新方法,用于训练可解释的 GAM 模型,这些模型可自动纯化以在单次前向传播中计算 Shapley 值。最后,我们提供理论结果,表明 GAM 模型的有限表示能力正是现有 SHAP 方法的致命弱点,并讨论了这一发现对 SHAP 在计算机视觉和自然语言处理中现代用法的影响。

关键词

引用

@article{arxiv.2502.14177,
  title  = {InstaSHAP: Interpretable Additive Models Explain Shapley Values Instantly},
  author = {James Enouen and Yan Liu},
  journal= {arXiv preprint arXiv:2502.14177},
  year   = {2025}
}