基于数据的纵向弥散系数比较综述及AI驱动符号模型:以自然河流为例
机器学习
2021-07-19 v2 数据分析、统计与概率
摘要
更好地理解自然河流中的弥散过程需要了解纵向弥散系数(LDC)。已有多种方法用于预测LDC,这些研究可分为三类:解析方法、统计方法以及机器学习驱动的研究(隐式与显式)。然而,目前仍缺乏对这些方法的综合评估。本文首先对这些方法进行了深入分析并指出其缺陷,分析基于一个包含全球660组水力与河道特性样本的大型数据库。通过采用最大相异度子集选择(SSMD)进行测试集选取、以及四分位距(IQR)剔除异常值,所用数据的可靠性与代表性得到提升。评估显示各类方法的排名为:机器学习驱动方法 > 统计方法 > 解析方法。隐式机器学习驱动方法本质上是黑箱,而显式机器学习驱动方法在LDC预测方面更具潜力。此外,过拟合是现有模型的普遍问题,这些模型还受限于固定的参数组合。为建立性能更高且可解释的LDC预测模型,我们设计了一种称为演化符号回归网络(ESRN)的新型符号回归方法,它结合了遗传算法与神经网络,并引入策略以避免过拟合和探索更多参数组合。结果表明,ESRN模型在性能上优于其他现有符号模型。所提模型因对参数要求低(仅需w和U*)而适用于实际工程问题,能在无法进行野外试验或仅能获得有限现场信息的情况下提供可信的解决方案。
引用
@article{arxiv.2106.11026,
title = {A data-based comparative review and AI-driven symbolic model for longitudinal dispersion coefficient in natural streams},
author = {Yifeng Zhao and Zicheng Liu and Pei Zhang and S. A. Galindo-Torres and Stan Z. Li},
journal= {arXiv preprint arXiv:2106.11026},
year = {2021}
}
备注
Due to the limitation "The abstract field cannot be longer than 1,920 characters", the abstract here is shorter than that in the PDF file Subjects