面向南非利奥普克 dam 的卫星-表面积机器学习储量模型:分段敏感评估与运营部署
摘要
可靠的每日储量估计是半干旱地区水资源分配和旱情应对决策的关键。利奥普克 dam(南非奥利弗兰特河的主要储水库)的常规评级曲线因沉积物积累和不规则抽水而变得越来越不确定。我们整合了 1984-2024 年 Digital Earth Africa (DEA) 的 40 年数字表面积档案与实测水位数据,开发数据驱动的体积预测模型,满足最大 9.14% 的误差容限及 90 天抽水约束。考察了四层特征集合:(i) 原始水体面积;(ii) 加上幂律“计算体积”代理;(iii) 加上六项河流几何指标;(iv) 加上完整的供水标高。评估了五种候选算法:梯度提升 (GB)、随机森林 (RF)、岭回归 (RI)、套索回归 (LA) 和弹性网 (EN),采用 20 次随机搜索进行调参,并采用五折时间序列分割以消除前瞻偏差。预测误差被分为两个区间:低于 250×10^6 立方米 (Low) 和超过 250×10^6 立方米 (High) 的储量区间。岭回归获得的最低交叉验证 RMSE 为 12.3×10^6 立方米,优于 GB 提高 16%,优于 RF 提高 7%。在区间意义上,岭回归在 Low 区间表现更佳(误差 18.0 万立方米 vs GB 的 22.7 万立方米),在 High 区间与 RF 挂平(约 12 万立方米)。样本诊断显示 GB 的显著优势(6.8-5.4 万立方米)是过拟合的假象。结合 GB、RF 和岭回归的 Ridge meta stacking 集成模型将整体 RMSE 降至约 11 万立方米(约占实际容量的 3%)。我们建议:(i) 每日重新训练 GB 用于常规运营;(ii) 使用岭回归用于旱情预警;(iii) 使用叠加模型用于全天气仪表板。建议定期滚动重新训练并采用分段特定指标,以保持运营准确率在部门水资源与卫生部规定的 5% 阈值以下。
引用
@article{arxiv.2502.19989,
title = {Satellite-Surface-Area Machine-Learning Models for Reservoir Storage Estimation: Regime-Sensitive Evaluation and Operational Deployment at Loskop Dam, South Africa},
author = {Hugo Retief and Kayathri and Vigneswaran and Surajit Ghosh and Mariangel Garcia Andarcia and Chris Dickens},
journal= {arXiv preprint arXiv:2502.19989},
year = {2025}
}
备注
20 pages, 9 Figures