中文

FormationEval:面向石油地质学的开放式多选基准测试

计算与语言 2026-02-17 v2 人工智能 机器学习 地球物理

摘要

本文介绍了 FormationEval,这是一个用于评估语言模型在石油地质学和地下学科领域表现的开放式多选题基准测试数据集。该数据集包含 505 题,覆盖七个领域,包括地质物理学、石油地质学和储层工程,数据来源于三个权威资源,采用推理模型配合详细指令和基于概念的方法构建,避免逐字复制受版权保护的文本。每题均包含来源元数据,以支持可追溯性和审计。评估覆盖来自 OpenAI、Anthropic、Google、Meta 以及开源权重模型等主要提供商的 72 个模型。顶级模型准确率超过 97%,其中 Gemini 3 Pro Preview 达到 99.8%,而各领域和模型等级之间仍存在差距。在开源权重模型中,GLM-4.7 以 98.6% 的准确率领先,多个 DeepSeek、Llama、Qwen 和 Mistral 模型也超过 93%。开源模型与闭源模型之间的性能差距小于人们预期,多个低成本开源模型准确率超过 90%。地质物理学在所有模型中表现最具挑战性,而较小模型的性能波动更大。本数据集中残余长度偏差(正确答案倾向于较长)得到记录,并在构建过程中应用了偏差缓解策略。基准测试、评估代码及结果均公开可用。

关键词

引用

@article{arxiv.2601.02158,
  title  = {FormationEval, an open multiple-choice benchmark for petroleum geoscience},
  author = {Almaz Ermilov},
  journal= {arXiv preprint arXiv:2601.02158},
  year   = {2026}
}

备注

v2: expanded related work, added validation details, difficulty-domain table, community feedback website (at https://www.formationeval.no). 28 pages, 8 figures, 11 tables. Benchmark and code at https://github.com/AlmazErmilov/FormationEval-an-Open-Benchmark-for-Oil-Gas-Geoscience-MCQ-Evaluation