Morán特征向量能否提升空间数据的机器学习?来自合成数据验证的洞见
机器学习
2025-04-18 v1 计量经济学
机器学习
摘要
Morán特征向量空间过滤(Moran Eigenvector Spatial Filtering, ESF)方法在统计模型中考虑空间效应方面显示出前景。这种做法能否扩展到机器学习中?本文检验了在机器学习模型中使用Morán特征向量作为额外空间特征的有效性。我们生成包含已知过程的合成数据集,这些过程涉及跨两种不同几何形状的空间变动性和非线性效应。测试使用不同空间权重矩阵计算的Morán特征向量,分别考虑和不考虑先验特征向量选择。我们评估了流行的机器学习模型,包括随机森林、LightGBM、XGBoost 和 TabNet,并根据交叉验证 R2 值对比仅使用坐标作为特征的模型性能。我们还从模型中提取系数和函数,并与 GeoShapley 方法进行比较。结果显示,在各种实验和数据集上,仅使用位置坐标的机器学习模型在准确性上优于基于特征向量的方法。此外,我们讨论了这些发现对于表现正空间自相关的空间过程是相关的,但并不一定适用于网络自相关和负空间自相关的情况,在后者情况下,Morán特征向量仍然有用。
引用
@article{arxiv.2504.12450,
title = {Can Moran Eigenvectors Improve Machine Learning of Spatial Data? Insights from Synthetic Data Validation},
author = {Ziqi Li and Zhan Peng},
journal= {arXiv preprint arXiv:2504.12450},
year = {2025}
}