置换决策树
机器学习
2024-06-03 v3
摘要
决策树是一种被广泛理解的机器学习模型,其基于最小化内部节点的不纯度。最常见的不纯度度量是香农熵和基尼不纯度。这些不纯度度量对训练数据的顺序不敏感,因此所获得的最终树对任意数据置换都是不变的。当数据实例之间存在时间顺序依赖关系时,这在建模方面是一个局限。在本研究中,我们首次提出采用压缩代价(Effort-To-Compress, ETC)——一种复杂性度量,作为替代的不纯度度量。与香农熵和基尼不纯度不同,基于ETC的结构不纯度能够捕捉数据中的顺序依赖,从而针对同一数据实例的不同置换获得潜在不同的决策树,我们将此概念称为置换决策树(Permutation Decision Trees, PDT)。我们随后引入了使用置换决策树实现的置换装袋(Permutation Bagging)概念,无需随机特征选择和子采样。我们在多个真实世界数据集上进行了置换决策树与经典决策树的性能比较,包括Appendicitis、Breast Cancer Wisconsin、Diabetes Pima Indian、Ionosphere、Iris、Sonar和Wine。我们的发现表明,PDT在大多数数据集上表现出与经典决策树相当的性能。值得注意的是,在某些情况下,PDT甚至略微超越了经典决策树的性能。在将置换装袋与随机森林(Random Forest)比较时,我们使用仅21棵树便达到了由50至1000棵树组成的随机森林模型的相当性能。这凸显了置换装袋在以显著更少的树实现相当性能结果方面的效率与有效性。
引用
@article{arxiv.2306.02617,
title = {Permutation Decision Trees},
author = {Harikrishnan N B and Arham Jain and Nithin Nagaraj},
journal= {arXiv preprint arXiv:2306.02617},
year = {2024}
}
备注
15 pages, 8 figures