中文

忠于模型还是忠于数据?

机器学习 2020-06-30 v1 机器学习

摘要

近期多篇论文讨论了将Shapley值(一种解释联盟博弈的概念)应用于机器学习中的特征归因。然而,将机器学习模型连接到联盟博弈的正确方式一直存在争议。已提出的两种主要方法在已知特征的条件化方式上有所不同,使用(1)干预式或(2)观测式条件期望。虽然先前工作认为其中一种方法总体上更优,但我们认为该选择依赖于应用。此外,我们认为该选择归结为是期望忠于模型还是忠于数据。我们使用线性模型来研究这一选择。在推导出计算线性模型观测式条件期望Shapley值的高效方法后,我们研究了模拟数据中的相关性如何影响观测式条件期望Shapley值的收敛。最后,我们给出两个我们认为能代表特征归因可能用例的真实数据示例——(1)信用风险建模与(2)生物发现。我们展示了在不同场景中不同的价值函数选择表现更优,以及可能的归因如何受建模选择影响。

关键词

引用

@article{arxiv.2006.16234,
  title  = {True to the Model or True to the Data?},
  author = {Hugh Chen and Joseph D. Janizek and Scott Lundberg and Su-In Lee},
  journal= {arXiv preprint arXiv:2006.16234},
  year   = {2020}
}