中文

如何超越默认随机森林回归:大样本水文学应用中的超参数选择

应用统计 2023-05-15 v1

摘要

预测是水资源研究的核心部分。历史上,基于物理的模型更受青睐;然而,它们在流域尺度上建模水文过程方面大体上失败了,并且存在一些无法用物理方法建模的重要预测问题。因此,机器学习(ML)模型近年来被视为一种有效的替代方案。尽管这些模型可用,但经过良好优化的前沿 ML 策略并未在水资源研究中被广泛使用。这是因为使用前沿 ML 模型并优化超参数需要专业的数学与统计学知识。此外,某些分析需要大量模型训练,因此有时即便是专业统计学家也无法恰当优化超参数。为利用数据并有效推动该领域的科学进展,必须通过改进自动化机器学习资源,使 ML 模型为主题专家所用。诸如 XGBoost 之类的 ML 模型近来已被证明优于水资源研究中传统使用的随机森林(RF)模型。本研究基于超过 150 个与水相关的数据集,广泛比较了 XGBoost 与 RF。本研究为水科学家提供了快速、用户友好的 RF 与 XGBoost 模型优化途径。

关键词

引用

@article{arxiv.2305.07136,
  title  = {How to out-perform default random forest regression: choosing hyperparameters for applications in large-sample hydrology},
  author = {Divya K. Bilolikar and Aishwarya More and Aella Gong and Joseph Janssen},
  journal= {arXiv preprint arXiv:2305.07136},
  year   = {2023}
}