中文

流形斜随机森林:缩小与卷积深度网络差距之路

机器学习 2022-09-08 v5 机器学习

摘要

决策森林(森林),特别是随机森林和梯度提升树,在许多监督学习场景中相较于其他方法展现出最优精度。具体而言,森林在表格数据中主导其他方法,即当下特征空间为非结构化、信号对特征索引的置换保持不变时。然而,在位于流形上的结构化数据(如图像、文本和语音)中,深度网络(网络),特别是卷积深度网络(ConvNets),往往优于森林。我们推测造成此现象的原因至少部分在于网络的输入不仅是特征幅值,还包括其特征索引。相比之下,朴素的森林实现未能显式考虑特征索引。近期提出的一种森林方法表明,森林在 each node 隐式地从某特定分布采样随机矩阵。这些森林与某些类别的网络类似,通过学习将特征空间划分为对应于线性函数的凸多面体来进行学习。我们基于该方法构建并表明,可以以流形感知的方式选择分布以纳入特征局部性。我们展示了在特征位于三种不同流形上的数据上的经验性能:环面、图像和时间序列。此外,我们在多变量模拟设定中展示了其优势,并显示了其在预测癫痫患者手术结果以及从非运动脑区的原始立体定向 EEG 数据预测运动方向上的优越性。在所有模拟与真实数据中,流形斜随机森林(MORF)算法均优于忽略特征空间结构的方法,并对 ConvNets 的性能提出挑战。而且,MORF 运行快速,并保持可解释性与理论依据。

关键词

引用

@article{arxiv.1909.11799,
  title  = {Manifold Oblique Random Forests: Towards Closing the Gap on Convolutional Deep Networks},
  author = {Adam Li and Ronan Perry and Chester Huynh and Tyler M. Tomita and Ronak Mehta and Jesus Arroyo and Jesse Patsolic and Benjamin Falk and Joshua T. Vogelstein},
  journal= {arXiv preprint arXiv:1909.11799},
  year   = {2022}
}

备注

Updated manuscript based on review at SIMODS