中文

异质倾斜双随机森林

机器学习 2023-04-17 v1

摘要

决策树集成在 each 节点使用单一数据特征来划分数据。然而,这种划分方式可能无法捕捉数据的几何特性。因此,倾斜决策树在每个非叶节点生成倾斜超平面来划分数据。倾斜决策树能捕捉数据的几何特性,从而展现出更好的泛化能力。倾斜决策树的性能取决于倾斜超平面的生成方式以及用于生成这些超平面的数据。近来,异质随机森林(RaF)分类器中使用了多个分类器,但它未能生成适当深度的树。此外,双 RaF 研究最近指出,可通过在每个非叶节点对数据进行自助采样并划分原始数据而非自助采样数据来生成更大的树。异质 RaF 的研究缺乏更大树的生成,而基于双 RaF 的模型未能获取数据的几何特征。为解决这些不足,我们提出异质倾斜双随机森林。所提模型在每个非叶节点对自助采样数据采用若干线性分类器,并基于最优线性分类器划分原始数据。最优超平面对应于基于优化不纯度准则的模型。实验分析表明,所引入的异质双随机森林性能优于基线模型。为证明所提异质双随机森林的有效性,我们将其用于精神分裂症疾病的诊断。与基线模型相比,所提模型更准确地预测了该疾病。

关键词

引用

@article{arxiv.2304.06788,
  title  = {Heterogeneous Oblique Double Random Forest},
  author = {M. A. Ganaie and M. Tanveer and I. Beheshti and N. Ahmad and P. N. Suganthan},
  journal= {arXiv preprint arXiv:2304.06788},
  year   = {2023}
}