强模型的 Shapley 边际盈余
机器学习
2024-08-19 v1 机器学习
摘要
Shapley 值在机器学习中被广泛用于解释模型预测和估计协变量的重要性。准确解释模型对于现实世界的模型至关重要,既有助于决策制定,也有助于推断真实数据生成过程(DGP)的性质。在本文中,我们证明了虽然基于模型的 Shapley 值可能是模型预测的准确解释器,但机器学习模型本身往往是 DGP 的较差解释器,即使模型高度准确。特别是在存在相互关联或噪声变量的情况下,高度预测性模型的输出可能无法考虑这些关系。这意味着对训练模型行为的解释可能无法为 DGP 提供有意义的洞察。在本文中,我们引入了一种新的变量重要性算法——强模型的 Shapley 边际盈余,通过采样可能模型的空间来得出特征重要性的推断性度量。我们将该方法与其他流行的特征重要性方法(基于 Shapley 和非基于 Shapley 的)进行了比较,并在推断能力方面展示了相对于其他方法的显著优势。
引用
@article{arxiv.2408.08845,
title = {Shapley Marginal Surplus for Strong Models},
author = {Daniel de Marchi and Michael Kosorok and Scott de Marchi},
journal= {arXiv preprint arXiv:2408.08845},
year = {2024}
}