中文

解释数据还是解释模型?揭示非线性依赖关系的 Shapley 值

机器学习 2021-03-09 v4 机器学习

摘要

Shapley 值因其吸引人的公理化、灵活性以及在满足某些“公平性”概念上的唯一性,在机器学习文献中变得越来越受欢迎。这种灵活性源于 Shapley 值 \textit{博弈公式} 的多种潜在形式。这种灵活性的后果之一是,现在有许多类型的 Shapley 值被讨论,这种多样性是潜在误解的来源。据我们所知,机器学习和统计学文献中所有现有的博弈公式都属于我们称之为博弈公式的模型依赖类别。在这项工作中,我们考虑了一种替代且新颖的公式,从而产生了我们称之为模型无关 Shapley 值的第一个实例。这些 Shapley 值使用非线性依赖的非参数度量作为特征函数。这些 Shapley 值的优势在于其能够揭示和归因特征之间的非线性依赖关系。我们介绍并演示了将能量距离相关性、仿射不变距离相关性和 Hilbert-Schmidt 独立性准则作为 Shapley 值特征函数的使用。特别地,我们展示了它们在探索性数据分析和模型诊断方面的潜在价值。最后,我们将该方法有趣地应用于一个经典的医学调查数据集进行说明。

关键词

引用

@article{arxiv.2007.06011,
  title  = {Explaining the data or explaining a model? Shapley values that uncover non-linear dependencies},
  author = {Daniel Vidali Fryer and Inga Strümke and Hien Nguyen},
  journal= {arXiv preprint arXiv:2007.06011},
  year   = {2021}
}

备注

26 pages, 7 figures, 2 tables