中文

最优决策树还是贪心决策树?重新审视它们的目标、调优与性能

交换代数 2026-05-14 v2

摘要

最近,针对最优决策树(ODT)的方法越来越受关注,这些方法直接全局优化准确度,而与传统方法不同,后者在局部优化 impurity 或信息指标方面。然而,最优方法的价值尚未得到良好理解,因为文献提供了相互矛盾的结果,其中一些研究表明 ODT 在测试样本外性能方面优于贪心方法,而另一些研究则显示相反结果。在一次新颖的大规模实验研究中,我们为决策树的设计和行为提供了新的见解。特别是,我们识别并分析了相对不被充分关注的两个方面:ODT 所使用的目标函数以及调优技术。因此,我们回答了这三个问题:在 ODT 中应优化什么目标函数;如何调优 ODT;以及最优方法与贪心方法如何比较?我们的实验评估在 180 个真实和合成数据集上检验了 11 种目标函数、6 种调优方法以及文献中 6 项关于最优和贪心方法的主张。通过我们的分析,无论从概念还是实验角度来看,我们展示了(非)凸目标函数在贪心和最优方法中的作用;我们强调正确调优 ODT 的重要性;支持和驳斥了文献中的若干主张;为研究人员和实践者提供了关于贪心方法和最优方法使用的明确建议;并提供代码以进行未来比较。

关键词

引用

@article{arxiv.2409.12787,
  title  = {Uniform bounds on projective dimension and Castelnuovo-Mumford regularity},
  author = {Giulio Caviglia and Alessandro De Stefani},
  journal= {arXiv preprint arXiv:2409.12787},
  year   = {2026}
}

备注

v2: minor changes