中文

预测地下水重金属污染的智能集成学习框架

机器学习 2026-05-04 v1 人工智能 数据分析、统计与概率 地球物理 应用统计 机器学习

摘要

Densu 河流盆地的地下水正日益受到重金属污染的威胁,但常规方法难以捕捉污染指示器的统计复杂性和空间异质性。一个关键挑战是对 Heavy Metal Pollution Index(HPI)建模,它通常呈偏斜分布,并受到相关污染物的影响,导致在未进行变换的情况下产生偏差预测。本研究开发了一个集成响应变换与嵌套交叉验证集成机器学习的预测框架。对 HPI 应用了三种变换(原始值、对数、正态共轭),并在六种学习器上进行评估:支持向量回归(SVM)、kk-最近邻(k-NN)、CART、弹性网、核岭回归,以及堆叠 Lasso 集成。原始尺度模型产生了虚高的拟合度(弹性网和堆叠集成 R21.0R^2 \approx 1.0),暗示过度乐观。对数变换稳定了方差(SVM: R2=0.93R^2 = 0.93, RMSE =0.18= 0.18;k-NN: R2=0.92R^2 = 0.92, RMSE =0.20= 0.20)。正态共轭给出了最可靠的结果:堆叠集成 R2=0.96R^2 = 0.96(RMSE =0.19= 0.19),其他学习器保持高准确率。基于共轭的模型改进了残差并生成了空间上合理的地图。DBSCAN 聚类揭示了 Fe 和 Mn 是主要的 HPI 贡献者,与区域地下水化学一致。局限性包括依赖随机(而非空间)交叉验证以及盆地特定的范围。未来工作应探索空间验证和其他地质背景。总体而言,分布感知的集成学习结合聚类诊断提供了对地下水污染的稳健、可解释的评估。

关键词

引用

@article{arxiv.2605.00056,
  title  = {Smart Ensemble Learning Framework for Predicting Groundwater Heavy Metal Pollution},
  author = {T. Ansah-Narh and G. Y. Afrifa and J. B. Tandoh and K. Asare and M. Addi and K. E. Yorke and D. M. A. Akpoley and K. Aidoo and S. K. Fosuhene},
  journal= {arXiv preprint arXiv:2605.00056},
  year   = {2026}
}

备注

53 pages, 16 figures, accepted for publication in Earth Systems and Environment (2026)