中文

分裂至关重要:预测变量的单调变换如何提升决策树模型的预测效果

机器学习 2016-11-16 v1 机器学习

摘要

人们普遍认为,决策树模型的预测精度在单个预测变量经过任何严格单调变换后保持不变。然而,当预测新观测值时,若其取值未在训练集中出现且接近树规则的分裂点位置,这一说法可能不成立。当树的分裂点基于极少量观测值估计时,预测误差对分裂点插值方式高度敏感:仅用10个观测值构建分裂时,误分类错误率可达9%,而依赖100个观测值时则降至1%。本研究比较了分裂点插值替代方法的性能,并得出结论:最佳选择是取树分裂点两侧最近两点之间的中点。此外,若预测变量的(连续)分布已知,则利用其概率积分变换(“分位数变换”)可将模型的插值误差平均降低约一半。据此,本研究为决策树模型(包括装袋法和随机森林)的开发者和使用者提供了指导。

关键词

引用

@article{arxiv.1611.04561,
  title  = {Splitting matters: how monotone transformation of predictor variables may improve the predictions of decision tree models},
  author = {Tal Galili and Isaac Meilijson},
  journal= {arXiv preprint arXiv:1611.04561},
  year   = {2016}
}