HydroAgent:通过仿真导向强化学习关闭前沿 LLM 与人类专家在水文模型校准之间的差距
摘要
分布式水文模型校准是运营水资源管理中的关键瓶颈——流量预测、水库运行、干旱监测、基础设施设计和洪水预报都依赖于此。每个流域都需要专家将水景象特征转化为高维参数向量的调整, resulting workflow does not transfer between watersheds. 我们提出的问题是:是否可以用前沿大语言模型(LLM)智能体取代人类水文模型师,如果不能,又需要什么?我们对九个前沿 LLM 智能体——Claude Opus 4.6/4.7、Sonnet 4.6、GPT-5/5.4/5.4-pro、Gemini 2.5-pro/3.1-pro/3-flash——在美国国家气象局用于暴雨预报的运营 CREST 分布式水文模型上进行基准测试。最佳 20 轮 Nash-Sutcliffe 效率(NSE)在 329-40,792 km² 的四个留置测站范围内分别为 -0.16(GPT-5.4)至 0.75(Sonnet 4.6);该上限在所有三个供应商和能力层级上均可复现,最强模型集中在 0.65-0.75 区间,没有模型在除 Opus-4.7 在一个测站之外的任何测站上达到人类专家参考值。我们认为这一差距并非参数计数问题,而是领域 grounding 问题。随后我们提出 HYDROAGENT,通过在 2,576 个专家校准轨迹上进行监督微调,并使用 NSE 作为来自在线 CREST 模拟的可验证奖励,通过群体相对策略优化(Group-Relative Policy Optimization)实现基于仿真反馈的强化学习(RLSF)。对于地球系统科学来说,一个小型领域调优的策略,配合仿真中RL,是一条比扩大通用前沿模型更高效且更符合物理的路径,地球数据的多模态丰富性——遥感、现场时间序列和预报叙述——使得领域智能体成为 AI 向物理科学的杠杆方向。
引用
@article{arxiv.2605.17792,
title = {HydroAgent: Closing the Gap Between Frontier LLMs and Human Experts in Hydrologic Model Calibration via Simulator-Grounded RL},
author = {Zhi Li and Songkun Yan and Jie Cao and Mofan Zhang and Anjiang Wei and Jinwoong Yoo and Yang Hong},
journal= {arXiv preprint arXiv:2605.17792},
year = {2026}
}