面向相关数据的随机森林
机器学习
2021-06-29 v2 机器学习
统计理论
统计方法学
统计理论
摘要
随机森林(RF)是估计回归函数最流行的方法之一。RF 算法基于节点内均值与方差的局部特性,在误差为独立同分布(i.i.d.)时十分理想。对于时间序列与空间设定等相关数据过程,所有节点中的数据均相关,局部操作会忽略这种依赖性。此外,RF 涉及对相关数据的重采样,违背了自助法(bootstrap)的原理。理论上,RF 的一致性已在 i.i.d. 误差下建立,但相关误差情形则鲜有可知。我们提出 RF-GLS,作为 RF 在相关误差过程下的新颖扩展,其方式类似于广义最小二乘(GLS)在依赖情形下对线性模型普通最小二乘(OLS)的根本性扩展。该扩展的关键在于将回归树中局部决策等价表示为全局 OLS 优化,再以 GLS 损失替代之,从而构建 GLS 式回归树。这也协同解决了重采样问题,因为使用 GLS 损失相当于对不相关对比量(预白化数据)而非相关数据进行重采样。对于空间设定,RF-GLS 可与高斯过程相关误差结合,在新位置生成克里金(kriging)预测。RF 成为以单位工作协方差矩阵为特例的 RF-GLS。我们在 beta-(绝对正则)混合误差过程下建立了 RF-GLS 的一致性,并表明这一一般结果涵盖了自回归时间序列与空间 Matern 高斯过程等重要情形。作为副产品,我们也建立了 RF 在 beta-混合过程下的一致性,据我们所知,这是 RF 在依赖情形下首个此类结果。我们通过实验实证展示了 RF-GLS 在依赖情形下于估计与预测上相对 RF 的提升。
引用
@article{arxiv.2007.15421,
title = {Random Forests for dependent data},
author = {Arkajyoti Saha and Sumanta Basu and Abhirup Datta},
journal= {arXiv preprint arXiv:2007.15421},
year = {2021}
}