可解释机器学习中 SHAP 分数的分布不确定性
人工智能
2024-08-14 v4 机器学习
计算机科学中的逻辑
摘要
归因分数反映了输入实体中的特征值对机器学习模型输出的重要程度。最流行的归因分数之一是 SHAP 分数,它是联盟博弈论中一般 Shapley 值的一种实例化。该分数的定义依赖于实体总体上的概率分布。由于精确分布通常是未知的,需要主观指定或从数据中估计,这可能导致误导性的特征分数。在本文中,我们提出了一个在未知实体总体分布下对 SHAP 分数进行推理的原则性框架。在我们的框架中,我们考虑了一个包含潜在分布的不确定性区域,而特征的 SHAP 分数成为定义在该区域上的函数。我们研究了寻找该函数最大值和最小值的基本问题,这使我们能够确定所有特征的 SHAP 分数的紧致范围。特别地,我们精确定位了这些问题及其他相关问题的复杂度,证明它们是 NP 完全的。最后,我们在真实世界数据集上进行了实验,表明我们的框架有助于实现更稳健的特征评分。
引用
@article{arxiv.2401.12731,
title = {The Distributional Uncertainty of the SHAP score in Explainable Machine Learning},
author = {Santiago Cifuentes and Leopoldo Bertossi and Nina Pardal and Sergio Abriola and Maria Vanina Martinez and Miguel Romero},
journal= {arXiv preprint arXiv:2401.12731},
year = {2024}
}
备注
In ECAI 2024 proceedings