使用空间数据对统计与机器学习模型进行性能评估与超参数调优
机器学习
2019-10-07 v1 机器学习
统计方法学
摘要
近年来,机器学习算法在生态建模领域因其在分类问题的预测性能方面表现出色而受到欢迎。尽管由于在 R 等常用统计编程语言中有完善的文档集成,此类算法的应用在过去几年中得到了极大简化,但在生态建模领域仍存在一些与无偏性能估计、使用超参数调优优化算法以及空间自相关相关的实际挑战。我们通过将几种广泛使用的机器学习算法(如提升回归树(BRT)、加权 k 近邻(WKNN)、随机森林(RF)和支持向量机(SVM))与传统的参数化算法(如逻辑回归(GLM))和半参数化算法(如广义加性模型(GAM))进行比较来解决这些问题。使用包括超参数调优方法在内的不同嵌套交叉验证方法来评估模型性能,旨在获得偏差降低的性能估计。作为案例研究,使用温度、降水、土壤或岩性等常见环境变量作为预测因子,研究了西班牙巴斯克地区森林疾病松枯梢病菌的空间分布。结果表明,GAM 和 RF(平均 AUROC 估计值为 0.708 和 0.699)在预测精度上优于所有其他方法。对于该数据集,超参数调优的效果在约 50 次迭代后达到饱和。GAM 和 RF 的偏差降低(空间交叉验证)与过于乐观(非空间交叉验证)性能估计之间的 AUROC 差异分别为 0.167 (24%) 和 0.213 (30%)。建议在对空间数据进行交叉验证超参数调优时也使用空间划分。
引用
@article{arxiv.1803.11266,
title = {Performance evaluation and hyperparameter tuning of statistical and machine-learning models using spatial data},
author = {Patrick Schratz and Jannes Muenchow and Eugenia Iturritxa and Jakob Richter and Alexander Brenning},
journal= {arXiv preprint arXiv:1803.11266},
year = {2019}
}