基于加和次序实验设计的 Shapley 值快速近似
机器学习
2023-09-19 v1 机器学习
统计方法学
摘要
Shapley 值最初是计量经济学中用于公平分配联盟博弈中收益与成本的概念。近几十年来,其应用已扩展至营销、工程与机器学习等其他领域。例如,它为敏感性分析、面向可解释机器学习的局部模型解释、社交网络节点重要性、归因模型等问题提供了合理的解。然而,其沉重的计算负担早已被认识到却鲜有研究。具体地,在 人联盟博弈中,计算一个 Shapley 值需要评估 或 个边际贡献值,取决于采用 Shapley 值的排列或组合形式。因此当 较大时计算 Shapley 值变得不可行。常见的补救办法是取排列的随机样本来替代完整排列列表。我们发现可设计一种先进的抽样方案,比简单随机抽样(SRS)更准确地估计 Shapley 值。我们的抽样方案基于实验设计(DOE)领域的组合结构,特别是用于研究组件次序如何影响输出的加和次序实验设计。我们证明所得估计是无偏的,且有时能确定性地恢复原始 Shapley 值。理论与模拟结果均表明,我们基于 DOE 的抽样方案在估计精度上优于 SRS。令人惊讶的是,它也比 SRS 略快。最后,对秀丽隐杆线虫神经系统与 9/11 恐怖分子网络进行了真实数据分析。
引用
@article{arxiv.2309.08923,
title = {Fast Approximation of the Shapley Values Based on Order-of-Addition Experimental Designs},
author = {Liuqing Yang and Yongdao Zhou and Haoda Fu and Min-Qian Liu and Wei Zheng},
journal= {arXiv preprint arXiv:2309.08923},
year = {2023}
}