评估大型语言模型在水文科学与工程领域的知识水平
摘要
水文科学与工程 (Hydro-SE) 是一个至关重要且不可替代的领域,保障人类用水、产生清洁水力发电、减轻洪涝与干旱灾害。Hydro-SE 具有多目标,本质上是一个跨学科领域,将科学知识与工程专长紧密结合。这种集成要求在决策过程中进行大量专家协作,这为智能化系统带来了挑战。随着大型语言模型 (LLM) 的快速发展,其在 Hydro-SE 领域的应用潜力正受到广泛关注。然而,LLM 在 Hydro-SE 领域的知识与应用能力尚未得到充分评估。为此,我们提出了 Hydro-SE LLM 评估基准 (Hydro-SE Bench),包含 4000 题多选问答。Hydro-SE Bench 涵盖九个子领域,能够评估 LLM 在基本概念知识、工程应用能力和推理计算能力方面的表现。在 Hydro-SE Bench 上的评估结果显示,商业 LLM 的准确率在 0.74 至 0.80 之间,而小参数 LLM 的准确率在 0.41 至 0.68 之间。虽然 LLM 在与自然科学与物理科学密切相关的子领域表现良好,但在行业标准和水力结构等领域专门知识方面仍显薄弱。模型规模主要改善了推理与计算能力,但 LLM 在实际工程应用方面的问题仍有很大提升空间。这一研究揭示了 LLM 在 Hydro-SE 任务中的优势与不足,为模型开发者提供明确的训练目标,也为 Hydro-SE 研究者提供了实际应用 LLM 的指导。
引用
@article{arxiv.2512.03672,
title = {Evaluating Hydro-Science and Engineering Knowledge of Large Language Models},
author = {Shiruo Hu and Wenbo Shan and Yingjia Li and Zhiqi Wan and Xinpeng Yu and Yunjia Qi and Haotian Xia and Yang Xiao and Dingxiao Liu and Jiaru Wang and Chenxu Gong and Ruixi Zhang and Shuyue Wu and Shibo Cui and Chee Hui Lai and Wei Luo and Yubin He and Bin Xu and Jianshi Zhao},
journal= {arXiv preprint arXiv:2512.03672},
year = {2025}
}
备注
Hydro-SE Bench sets a new benchmark for the evaluation of LLMs in the Hydro-Science and Engineering domain, with its code and data available at \url{https://github.com/sheishijun/Hydro-SE-Bench}