中文

技术报告:通过分层估计偏依赖

机器学习 2020-04-28 v4 机器学习

摘要

Friedman 提出的偏依赖曲线(FPD)是一种重要的模型解释工具,但业务分析师与科学家往往难以使用,他们通常缺乏选择、调优与评估机器学习模型的技能。同样的偏依赖算法在相同数据上对不同模型给出有显著差异的曲线也很常见,这使其精确性受到质疑。需要专业知识来区分数据中的模型伪影与真实关系。在本文中,我们提出了计算偏依赖曲线的方法,针对数值型(StratPD)与分类型解释变量(CatStratPD),它们直接基于训练数据而非模型预测工作。我们的方法提供偏依赖的直接估计,依赖于近似未知回归函数的偏导数,而无需先拟合模型再近似其偏导数。我们研究了当代偏依赖方法——包括 FPD、ALE 与 SHAP 方法——给出有偏结果的情形。此外,我们证明了我们的方法在合成数据上正确,并在真实数据集上合理成立。我们的目标并非论证基于模型的技术无用。相反,我们希望开启关于非参数偏依赖的新研究思路。

关键词

引用

@article{arxiv.1907.06698,
  title  = {Technical Report: Partial Dependence through Stratification},
  author = {Terence Parr and James D. Wilson},
  journal= {arXiv preprint arXiv:1907.06698},
  year   = {2020}
}

备注

Tweaks/clarifications, added ntrials optional hyper parameter, corrected interpretation of Integrated Gradients technique. For code, see repo https://github.com/parrt/stratx