中文

基于袋外评估与子装袋的分类最优树选择

机器学习 2021-01-01 v1 机器学习

摘要

过去二十年间,训练数据规模对机器学习方法的影响已得到充分研究。基于树的机器学习方法的预测性能通常随训练数据规模增大而以递减速率提升。我们在最优树集成(OTE)中研究此现象,该方法因内部验证而无法从部分训练观测中学习。为此,针对 OTE 提出了改进的树选择方法,以弥补内部验证中训练观测的丢失。在第一种方法中,相应的袋外(OOB)观测被用于每棵树的个体与集体性能评估。依据树在 OOB 观测上的个体表现进行排序。选取一定数量的排名靠前树木,并从最准确树开始,逐棵加入后续树,利用为该被加入树所取自助样本中所留出的 OOB 观测记录其影响。若某树提升了集成的预测精度,则被选中。在第二种方法中,树在训练数据的随机子集(无放回抽取,即子装袋子 bagging)上生长,而非自助样本(有放回抽取)。与第一种方法类似,每个相应树的剩余观测被用于个体与集体评估。对 21 个基准数据集与模拟研究的分析表明,改进方法相较于 OTE 及其他最先进方法具有更优性能。

关键词

引用

@article{arxiv.2012.15301,
  title  = {Optimal trees selection for classification via out-of-bag assessment and sub-bagging},
  author = {Zardad Khan and Naz Gul and Nosheen Faiz and Asma Gul and Werner Adler and Berthold Lausen},
  journal= {arXiv preprint arXiv:2012.15301},
  year   = {2021}
}

备注

20 pages,4 figures