偏依赖图与排列特征重要性相对于数据生成过程的关系
机器学习
2023-11-09 v1 机器学习
摘要
科学家与从业者日益依赖机器学习来建模数据并得出结论。与统计建模方法相比,机器学习对数据结构(如线性)所作的显式假设更少。然而,其模型参数通常难以与数据生成过程直接关联。为了了解所建模的关系,常使用偏依赖(PD)图和排列特征重要性(PFI)作为解释方法。然而,PD和PFI缺乏将其与数据生成过程相联系的理论。我们将PD和PFI形式化为根植于数据生成过程的真实估计目标的统计估计量。我们表明,由于统计偏差、模型方差和蒙特卡洛近似误差,PD和PFI估计会偏离该真实值。为考虑PD和PFI估计中的模型方差,我们基于模型重拟合提出了learner-PD和learner-PFI,并提出了修正的方差与置信区间估计量。
引用
@article{arxiv.2109.01433,
title = {Relating the Partial Dependence Plot and Permutation Feature Importance to the Data Generating Process},
author = {Christoph Molnar and Timo Freiesleben and Gunnar König and Giuseppe Casalicchio and Marvin N. Wright and Bernd Bischl},
journal= {arXiv preprint arXiv:2109.01433},
year = {2023}
}