中文

通过“邻域”分析进行模型拟合后探索

统计方法学 2018-06-06 v1

摘要

我们提出了一种用于评估由自适应回归过程(我们的主要关注点为lasso)所选择模型简单方法。该过程删除每个被选中的预测变量并重新拟合lasso,得到一组与所选模型“接近”的模型,称为“基模型”。若删除某预测变量导致模型预测能力显著下降,则该预测变量称为不可或缺的;否则,邻近模型称为可接受的,并可作为基模型的良好替代。这既提供了对每个变量预测贡献的评估,也提供了一组可替代所选模型的备选模型。本文中,我们将聚焦于交叉验证(CV)设定,模型的预测能力由其CV误差度量,基模型通过交叉验证调参。我们提出了一种比较基模型与邻近模型误差率的方法,以及检验某预测变量是否可舍弃的p值。我们还提出了一种称为模型分数的新量,其作用类似于用于控制第一类错误的p值。我们的提案与([Rinaldo 2016 Bootstrapping])的LOCO(leave-one-covarate-out,留一协变量)方法密切相关,而与稳定性选择([Meinshausen 2010 stability])关系较弱。我们称此过程为“邻域分析”,因其考察接近基模型的模型。它可应用于高斯回归数据、广义线性模型及其他带1\ell_1惩罚的监督学习问题,也可应用于最优子集与逐步回归过程。我们已用R语言将其实现为库,以配合著名的{\tt glmnet}库使用。

关键词

引用

@article{arxiv.1806.01326,
  title  = {Post model-fitting exploration via a "Next-Door" analysis},
  author = {Leying Guan and Robert Tibshirani},
  journal= {arXiv preprint arXiv:1806.01326},
  year   = {2018}
}