AtmosSci-Bench:评估大气科学领域大型语言模型的最新进展
机器学习
2025-10-07 v3 人工智能
摘要
大型语言模型 (LLMs) 的快速发展,特别是在推理能力方面,为解决大气科学中的复杂挑战和促进科学发现带来了变革性的潜力。然而,在该领域有效利用 LLMs 需要一个稳健且全面的评估基准。为此,我们提出了 AtmosSci-Bench,这是一个新颖的基准,旨在系统地评估 LLMs 在大气科学问题的五个核心类别上的表现:水文学、大气动力学、大气物理学、地球物理学和物理海洋学。AtmosSci-Bench 采用双格式设计,包含多项选择题 (MCQs) 和开放式问题 (OEQs),既能实现可扩展的自动化评估,又能对概念理解进行更深入的分析。我们采用基于模板的 MCQ 生成框架,通过符号扰动创建多样化的研究生水平问题,而 OEQ 则用于探究开放式推理。我们对代表性的 LLMs 进行了全面评估,将其分为四组:指令微调模型、高级推理模型、数学增强模型和特定领域的气候模型。我们的分析为 LLMs 在大气科学中的推理和问题解决能力提供了一些有趣的见解。我们相信,AtmosSci-Bench 可以通过提供一个标准且严格的评估框架,成为推进 LLMs 在气候服务中应用的关键一步。我们的源代码可在 https://github.com/Relaxed-System-Lab/AtmosSci-Bench 获取。
引用
@article{arxiv.2502.01159,
title = {AtmosSci-Bench: Evaluating the Recent Advance of Large Language Model for Atmospheric Science},
author = {Chenyue Li and Wen Deng and Mengqian Lu and Binhang Yuan},
journal= {arXiv preprint arXiv:2502.01159},
year = {2025}
}
备注
37 pages, 4 figures, 13 tables