中文

使用机器学习进行含缺失数据时间序列的数据驱动湖泊水质预测

机器学习 2026-01-23 v1

摘要

志愿者主导的湖泊监测产生不规则的、季节性的且存在许多空缺的时间序列,这些空缺源于冰盖、与天气相关的通行限制以及偶发的人为失误,使有害藻华的预测和早期预警变得复杂。我们研究了从缅因州湖泊收集的三十年原位记录中提取的包含 30 个湖泊的数据丰富子集上的塞氏盘深度(SDD)预测。缺失值通过链式方程多重插补(MICE)处理,我们使用归一化平均绝对误差指标评估性能以实现跨湖泊的可比性。在六个候选模型中,岭回归提供了最佳的平均测试性能。使用岭回归,我们随后量化了最小样本量,表明在向后近史记录协议下,该模型在平均每湖约 176 个训练样本下即可达到与全历史记录精度相差 5% 以内的水平。我们还确定了一个最小特征集,其中一个紧凑的四特征子集在相同的 5% 容差内与十三特征基线相匹配。综合这些结果,我们引入了一个联合可行性函数,该函数识别出足以实现保持在完整历史和完整特征基线 5% 误差范围内这一目标的最小训练历史和最少预测变量。在我们的研究中,达到 5% 精度目标需要约 64 个近期样本,且每湖仅需一个预测变量,突显了针对性监测的实用性。因此,我们的联合可行性策略在固定精度目标下统一了近史记录长度和特征选择,为湖泊研究人员设定采样工作量和测量优先级提供了一条简单高效的规则。

关键词

引用

@article{arxiv.2601.15503,
  title  = {Data-driven Lake Water Quality Forecasting for Time Series with Missing Data using Machine Learning},
  author = {Rishit Chatterjee and Tahiya Chowdhury},
  journal= {arXiv preprint arXiv:2601.15503},
  year   = {2026}
}

备注

8 pages, 4 figures, 3 tables