中文

使用动态量化在在线树回归器中执行分裂尝试

机器学习 2020-12-04 v2

摘要

在线决策树解决方案的一个核心方面是评估流入数据并支持模型增长。为此,树必须处理不同种类的输入特征并对其进行划分以从数据中学习。数值特征也不例外,且与其他类型特征相比带来了额外挑战,因为不存在选择最佳点进行分裂决策的平凡策略。该问题在回归任务中更具挑战性,因为特征与目标均为连续值。典型的在线解决方案在分裂尝试之间评估并存储所有被监测的点,这违背了实时应用所施加的约束。在本文中,我们引入量化观测器(Quantization Observer, QO),一种简单而有效的基于哈希的算法,用于监测并评估在线树回归器中数值特征的分裂点候选。QO 可轻松集成到增量决策树中,如 Hoeffding 树,其每个实例的监测成本为 O(1)O(1),评估分裂候选的成本为亚线性。先前解决方案的每次插入成本为 O(logn)O(\log n)(最佳情况)且评估分裂点为线性成本。我们广泛的实验设置凸显了 QO 在提供准确分裂点建议的同时,相比竞争方法消耗更少内存与处理时间的有效性。

关键词

引用

@article{arxiv.2012.00083,
  title  = {Using dynamical quantization to perform split attempts in online tree regressors},
  author = {Saulo Martiello Mastelini and Andre Carlos Ponce de Leon Ferreira de Carvalho},
  journal= {arXiv preprint arXiv:2012.00083},
  year   = {2020}
}

备注

Under consideration at Pattern Recognition Letters. The version sent to the journal was slightly modified to conform to the page limit