中文

统计提升中基学习器的剔除 —— 以分布回归为例

统计方法学 2022-02-04 v1 应用统计

摘要

我们提出一种用于分量式梯度提升中增强变量选择的新过程。统计提升是一种源自机器学习的计算方法,可在高维数据存在时拟合回归模型。此外,该算法可实现数据驱动的变量选择。然而在实践中,最终模型在某些情形下往往倾向于包含过多变量。这在低维数据(p<n)中尤为明显,我们观察到提升的缓慢过拟合行为。结果是有更多变量进入最终模型而未改变预测精度。这些假阳性多数以较小系数被纳入,因而影响微弱,却导致模型增大。我们试图通过给予算法剔除次要基学习器的机会来克服此问题。我们分析了新方法相对于包括更早停止的提升以及 twin boosting 等替代方法在变量选择与预测性能上的影响。我们以一项针对慢性肾脏病患者的正在进行队列研究的数据阐释了我们的方法,其中基于 beta 回归的分布回归方法选出了健康相关生活质量度量的最具影响预测因子。

关键词

引用

@article{arxiv.2202.01657,
  title  = {Deselection of Base-Learners for Statistical Boosting -- with an Application to Distributional Regression},
  author = {Annika Strömer and Christian Staerk and Nadja Klein and Leonie Weinhold and Stephanie Titze and Andreas Mayr},
  journal= {arXiv preprint arXiv:2202.01657},
  year   = {2022}
}