中文

如何基于聚合 SHAP 值安全地丢弃特征

机器学习 2025-04-01 v1 人工智能 机器学习

摘要

SHAP 是最流行的局部特征归因方法之一。给定函数 f 和输入 x,它量化每个特征对 f(x) 的贡献。近期,SHAP 越来越多地被用于全局洞察:从业者将许多数据点上的绝对 SHAP 值取平均以计算全局特征重要性分数,然后将其用于丢弃不重要的特征。在这项工作中,我们通过询问较小的聚合 SHAP 值是否必然意味着相应特征不影响该函数,来调查这种做法的合理性。遗憾的是,答案是否定的:即使第 i 个 SHAP 值在整个数据支撑集上为 0,也存在明显依赖于特征 i 的函数。问题在于,计算 SHAP 值涉及在数据支撑集之外的点上评估 f,而 f 可以被策略性地设计以掩盖其对特征 i 的依赖。为了解决这个问题,我们提议在扩展支撑集上聚合 SHAP 值,该支撑集是潜在分布边缘分布的乘积。通过这一修改,我们证明了较小的聚合 SHAP 值意味着我们可以安全地丢弃相应的特征。然后,我们将结果扩展到 KernelSHAP,这是实践中最流行的近似 SHAP 值的方法。我们表明,如果 KernelSHAP 是在扩展分布上计算的,则较小的聚合值即可证明特征移除的合理性。这一结果独立于 KernelSHAP 是否准确近似真实 SHAP 值而成立,使其成为表征 KernelSHAP 算法本身的首批理论结果之一。我们的发现具有理论和实践双重意义。我们引入了 Shapley 李代数,它提供的代数洞察可能有助于对 SHAP 进行更深入的研究,并且我们表明,随机置换数据矩阵的每一列能够实现基于聚合 SHAP 和 KernelSHAP 值安全地丢弃特征。

关键词

引用

@article{arxiv.2503.23111,
  title  = {How to safely discard features based on aggregate SHAP values},
  author = {Robi Bhattacharjee and Karolin Frohnapfel and Ulrike von Luxburg},
  journal= {arXiv preprint arXiv:2503.23111},
  year   = {2025}
}