决策树的自顶向下归纳:严格保证与固有局限
数据结构与算法
2019-11-19 v1 计算复杂性
机器学习
摘要
考虑以下为函数 构建决策树的启发式方法。将 最具影响力的变量 置于根节点,并分别在左、右子树上对子函数 和 递归;一旦树成为 的 -近似即终止。我们分析了该启发式方法的质量,得到了近乎匹配的上界与下界: 上界:对每个决策树大小为 的 以及每个 ,该启发式方法构建的决策树大小至多为 。 下界:对每个 以及 ,存在一个决策树大小为 的 ,使得该启发式方法构建的决策树大小为 。我们还得到了单调函数的上界与下界:分别为 和 。该下界反驳了 Fiat 和 Pechyony (2004) 以及 Lee (2009) 的猜想。我们的上界给出了在均匀分布下正确学习决策树的新算法。我们表明,这些受广泛采用且经验上成功的自顶向下决策树学习启发式方法(如 ID3、C4.5 和 CART)启发的算法,获得了可与当前最快算法(Ehrenfeucht 和 Haussler,1989)相媲美的可证明保证。我们的下界揭示了这些启发式方法的局限。最后,我们重访 Ehrenfeucht 和 Haussler 的经典工作。我们对其加以推广,给出了首个在均匀分布下实现多项式样本与内存复杂度、同时匹配其准多项式运行时间这一最优水平的正确学习算法。
引用
@article{arxiv.1911.07375,
title = {Top-down induction of decision trees: rigorous guarantees and inherent limitations},
author = {Guy Blanc and Jane Lange and Li-Yang Tan},
journal= {arXiv preprint arXiv:1911.07375},
year = {2019}
}