非参数特征影响与重要性
机器学习
2020-06-09 v1 机器学习
摘要
从业者在模型开发过程中使用特征重要性对弱预测变量进行排序和剔除,以简化模型并改善泛化能力。不幸的是,他们也经常将此类特征重要性度量与特征影响(即解释变量对响应变量的孤立效应)混为一谈。当重要性被不恰当地解释为影响以用于商业或医学洞察时,这会导致现实后果。计算重要性的主导方法是通过对拟合模型的探查,其适用于特征选择,但给出的特征影响度量失真。应用于同一数据集的同一方法可能因模型不同而产生不同特征重要性,使我们得出结论:影响应直接从数据计算。虽存在非参数特征选择算法,但它们通常提供特征排序而非影响或重要性度量,且通常聚焦于单变量与响应的关联。本文中,我们给出基于部分依赖曲线、直接作用于数据的特征影响与重要性的数学定义。为评估质量,我们使用三个真实数据集在预测任务上表明,由这些定义排序的特征与现有特征选择技术具有竞争力。
引用
@article{arxiv.2006.04750,
title = {Nonparametric Feature Impact and Importance},
author = {Terence Parr and James D. Wilson and Jeff Hamrick},
journal= {arXiv preprint arXiv:2006.04750},
year = {2020}
}