中文

基于树的方法中交叉验证变量选择提升预测性能

机器学习 2015-12-14 v1

摘要

生成树状模型的递归划分方法是预测建模中长期以来的主要内容,在过去十年中主要作为先进集成方法(如Boosting和Random Forest)中的“子学习器”。然而,常用建树方法的划分(或分裂)规则中存在一个基本缺陷,使它们无法平等地处理不同类型的变量。这一点最明显地体现在这些方法无法正确利用具有大量类别的分类变量,而这类变量在大数据新时代无处不在。此类变量往往信息量很大,但当前的树方法实质上让我们只能选择不使用它们,或者使模型面临严重的过拟合。我们提出了一个概念框架,使用留一法(LOO)交叉验证来选择分裂变量,然后对所选变量执行常规分裂(在我们的案例中,遵循CART的方法)。我们方法最重要的结果是,具有多类别的分类变量可以安全地用于建树,并且仅当它们有助于预测能力时才会被选中。我们通过广泛的模拟和真实数据分析证明,我们新颖的分裂方法显著改善了单树模型和利用树的集成方法的性能。重要的是,我们设计了一种用于LOO分裂变量选择的算法,在合理假设下,与CART相比,两类分类的整体计算复杂度没有增加。对于回归任务,我们的方法带来了更高的计算负担,将CART分裂规则搜索中的O(log(n))因子替换为O(n)项。

关键词

引用

@article{arxiv.1512.03444,
  title  = {Cross-Validated Variable Selection in Tree-Based Methods Improves Predictive Performance},
  author = {Amichai Painsky and Saharon Rosset},
  journal= {arXiv preprint arXiv:1512.03444},
  year   = {2015}
}