具有规则结构马蹄正则化的树集成
统计方法学
2018-02-16 v2 机器学习
摘要
我们提出一种用于灵活非线性回归和分类的贝叶斯模型,使用树集成。该模型基于Friedman和Popescu (2008)的RuleFit方法,其中来自决策树的规则和线性项用于L1正则化回归。我们通过用马蹄先验替换L1正则化来改进RuleFit,众所周知,马蹄先验能对噪声预测变量进行激进收缩,同时基本不触动重要信号。当大量规则用作预测变量时,这一点尤为重要,因为其中许多仅贡献噪声。我们的马蹄先验具有一个额外的层次结构,该结构对具有大量分裂的规则以及仅被少数观测满足的规则施加更强的先验收缩。我们先验的激进噪声收缩也使得用来自随机森林的额外树集合补充Friedman和Popescu (2008)中提升得到的规则成为可能,这为集成带来了理想的多样性。我们使用非常高效且易于实现的吉布斯采样器从后验分布采样。新模型在16个数据集上被证明优于RuleFit、BART和随机森林等最先进方法。该模型及其解释在著名的波士顿住房数据以及用于癌症分类的基因表达数据上进行了演示。后验采样、预测和用于解释模型结果的图形工具在一个公开可用的R包中实现。
引用
@article{arxiv.1702.05008,
title = {Tree Ensembles with Rule Structured Horseshoe Regularization},
author = {Malte Nalenz and Mattias Villani},
journal= {arXiv preprint arXiv:1702.05008},
year = {2018}
}
备注
24 pages. R package