EarthSE:评估 LLM 地球科学探索能力的基准
计算与语言
2025-06-02 v3 人工智能
摘要
大语言模型 (LLM) 的进步推动了对科学应用的热情,亟需此类基准如地球科学。现有基准要么呈现通用科学焦点,缺乏地球科学的特定性,要么覆盖孤立的子领域,缺乏整体评估。此外,当前基准通常忽略对 LLM 在开放式科学探索中能力的评估。本文提出了一个全面且专业的地球科学基准,用于评估 LLM 在该领域科学探索能力,涵盖从基础到高级水平。我们利用 100,000 篇科研论文的语料库,首先构建两个问答数据集:Earth-Iron 提供广泛的问答覆盖用于宽泛评估,Earth-Silver 具有更高难度以评估专业深度。这两个数据集涵盖五大地球球体、114 个学科和 11 个任务类别,评估科学探索所需的基础知识。最值得注意的是,我们引入了Earth-Gold,配以新指标,包含旨在评估 LLM 在科学探索中高级能力的数据集,包括方法引导、局限性分析和概念提议。广泛的实验结果揭示了 11 个领先 LLM 在不同领域和任务中的局限性,凸显了其科学探索能力仍有很大的提升空间。该基准已在 https://huggingface.co/ai-earth 提供。
引用
@article{arxiv.2505.17139,
title = {EarthSE: A Benchmark for Evaluating Earth Scientific Exploration Capability of LLMs},
author = {Wanghan Xu and Xiangyu Zhao and Yuhao Zhou and Xiaoyu Yue and Ben Fei and Fenghua Ling and Wenlong Zhang and Lei Bai},
journal= {arXiv preprint arXiv:2505.17139},
year = {2025}
}