面向二值地理空间数据的随机森林
统计方法学
2025-02-07 v2 机器学习
摘要
本手稿针对二值因变量的非线性回归发展了新方法与新理论,采用随机森林。现有的二值数据随机森林实现无法显式考虑地理空间和时间序列环境中常见的数据相关性。对于连续结果,近期工作已将随机森林(RF)扩展为RF-GLS,利用广义最小二乘(GLS)损失纳入空间协方差。然而,由于分类树中使用的基尼不纯度度量尚无已知扩展来建模依赖性,将该思想用于二值数据颇具挑战。我们表明,对于二值数据,GLS损失也是基尼不纯度度量的一种扩展,因为后者恰好等价于普通最小二乘(OLS)损失。这为将RF-GLS用于二值因变量的非参数均值函数估计提供了依据。我们随后考虑广义混合效应模型这一特例,它是二值地理空间数据的传统统计模型,将空间随机效应建模为高斯过程(GP)。我们提出了一种新颖的链接反演技术,将第一步中均值函数的RF-GLS估计嵌入广义混合效应模型框架,从而实现非线性协变量效应的估计并提供空间预测。我们确立了方法RF-GP在均值函数和协变量效应估计上的一致性。该理论对一类广义平稳绝对正则相依过程成立,包括具有Mat\'ern或紧支撑协方差的高斯过程以及自回归过程等常见选择。该理论放宽了可加均值函数的常见假设并考虑了非线性链接。我们证明RF-GP在模拟和真实世界数据的估计与预测上均优于竞争方法。
引用
@article{arxiv.2302.13828,
title = {Random forests for binary geospatial data},
author = {Arkajyoti Saha and Abhirup Datta},
journal= {arXiv preprint arXiv:2302.13828},
year = {2025}
}