变量重要性估计新兴方法的计算探索
机器学习
2022-08-09 v1 机器学习
摘要
估计变量重要性是现代机器学习中的一项基本任务。这有助于评估给定模型中特征的优劣。过去十年中开发了若干变量重要性估计技术。本文中,我们对新兴的变量重要性估计方法进行了计算与理论探索,即:最小绝对收缩与选择算子(LASSO)、支持向量机(SVM)、预测误差函数(PERF)、随机森林(RF)与极端梯度提升(XGBOOST),并在不同种类的真实与模拟数据上进行了测试。所有这些方法均可无缝处理回归与分类任务,但在处理含缺失值的数据时均失败。实现表明,PERF 在高度相关数据情况下性能最佳,RF 紧随其后。PERF 与 XGBOOST 是“数据饥渴”方法,它们在小数据量上性能最差,但在执行时间上最快。SVM 在数据集含许多冗余特征时最为合适。PERF 的一个优点是其在零处的自然截断,有助于分离正负分数:所有正分表示必要且显著的特征,而负分表示无用特征。RF 与 LASSO 非常通用,几乎可用于所有情形,尽管它们未给出最佳结果。
引用
@article{arxiv.2208.03373,
title = {A Computational Exploration of Emerging Methods of Variable Importance Estimation},
author = {Louis Mozart Kamdem and Ernest Fokoue},
journal= {arXiv preprint arXiv:2208.03373},
year = {2022}
}