中文

基于 Shapley 值的群体特征重要性高效非参数统计推断

统计方法学 2025-10-23 v1 机器学习

摘要

预测任务中变量的真实总体水平重要性提供了关于底层数据生成机制的有用知识,并有助于决定在后续实验中收集哪些测量值。对此重要性的有效统计推断是理解感兴趣总体的关键组成部分。我们提出了一种计算高效的步骤,用于估计并获得 Shapley 总体变量重要性度量(SPVIM)的有效统计推断。尽管真实 SPVIM 的计算复杂度随变量数量呈指数增长,我们提出了一种基于仅随机采样 Θ(n)\Theta(n) 个特征子集(给定 nn 个观测)的估计量。我们证明该估计量以渐近最优速率收敛。此外,通过推导估计量的渐近分布,我们构建了有效的置信区间和假设检验。我们的步骤在模拟中具有优良的有限样本表现,并且对于院内死亡率预测任务,在应用不同机器学习算法时产生了相似变量重要性估计。

关键词

引用

@article{arxiv.2006.09481,
  title  = {Efficient nonparametric statistical inference on population feature importance using Shapley values},
  author = {Brian D. Williamson and Jean Feng},
  journal= {arXiv preprint arXiv:2006.09481},
  year   = {2025}
}

备注

15 pages, 3 figures. To be published in the Proceedings of the Thirty-seventh International Conference on Machine Learning (ICML 2020)