中文

关于多元随机分类树:$l_0$稀疏性、VC维与分解方法

机器学习 2021-12-16 v2

摘要

决策树因其可解释性和良好精度而被广泛用作分类与回归模型。诸如CART之类的经典方法基于贪心策略,但近期最优决策树日益受到关注。我们研究了Blanquero等人(EJOR, vol. 284, 2020; COR, vol. 132, 2021)提出的用于(稀疏)最优随机分类树的非线性连续优化公式。稀疏性不仅对特征选择重要,也有助于提升可解释性。我们首先考虑基于 l0l_{0} “范数”的凹近似来使此类树稀疏化的替代方法。在24个数据集上与 l1l_1ll_{\infty} 正则化相比获得了有前景的结果。接着,我们推导了多元随机分类树VC维的界。最后,由于训练对大型数据集计算挑战大,我们提出了一种通用分解方案及其高效版本。在更大数据集上的实验表明,所提出的分解方法能够显著减少训练时间而不损害精度。

关键词

引用

@article{arxiv.2112.05239,
  title  = {On multivariate randomized classification trees: $l_0$-based sparsity, VC~dimension and decomposition methods},
  author = {Edoardo Amaldi and Antonio Consolo and Andrea Manno},
  journal= {arXiv preprint arXiv:2112.05239},
  year   = {2021}
}