中文

大型传感器网络中缺失亚小时降水数据的填补:一种机器学习方法

机器学习 2020-07-21 v2 应用统计 机器学习

摘要

以亚小时分辨率收集的降水数据具有高度随机性且降雨与非降雨时长极不均衡,这给缺失数据恢复带来特殊挑战。本文提出一种两步分析法,利用当前机器学习技术,将任务分解为(a)降雨与非降雨样本的分类,以及(b)对预测为降雨样本的绝对数值进行回归,以填补按30分钟间隔采样的降水数据。通过对英国37个气象站的研究,该机器学习过程在恢复降水数据方面比利用邻近雨量计的既有曲面拟合技术预测更准确。增加机器学习算法训练可用特征可提升性能,其中将目标站点的天气数据与外部来源的雨量计相融合可提供最高性能。该方法利用同步采集的环境数据中的信息来指导机器学习模型,从而对缺失降雨数据作出准确预测。从弱相关变量中捕捉复杂的非线性关系对于亚小时分辨率的数据恢复至关重要。此类数据恢复流程可被开发并部署,用于对持续高频数据集中的缺失值进行高度自动化且近乎即时的填补。

关键词

引用

@article{arxiv.2004.11123,
  title  = {Imputation of missing sub-hourly precipitation data in a large sensor network: a machine learning approach},
  author = {Benedict Delahaye Chivers and John Wallbank and Steven J. Cole and Ondrej Sebek and Simon Stanley and Matthew Fry and Georgios Leontidis},
  journal= {arXiv preprint arXiv:2004.11123},
  year   = {2020}
}

备注

24 pages, 7 figures, 5 tables