中文

SciEval:面向科学研究的多层级大语言模型评测基准

计算与语言 2024-11-08 v2

摘要

近来,使用大语言模型(LLMs)进行科学研究的兴趣日益增长。已有众多基准被提出以评估LLMs的科学研究能力。然而,当前的基准大多基于预先收集的客观题,这种设计存在数据泄露问题,且缺乏对主观问答能力的评估。本文提出SciEval,一个全面且多学科的评测基准以解决上述问题。基于布鲁姆分类学,SciEval涵盖四个维度以系统评估科学研究能力。特别地,我们基于科学原理设计了一个“动态”子集,以防止评估受到潜在数据泄露的影响。SciEval同时包含客观题与主观题。这些特性使SciEval成为评估LLMs科学研究能力更有效的基准。在多数先进LLMs上的综合实验表明,尽管GPT-4相较于其他LLMs取得了SOTA性能,仍存在 substantial 的提升空间,尤其是动态问题。代码与数据已公开于 https://github.com/OpenDFM/SciEval。

关键词

引用

@article{arxiv.2308.13149,
  title  = {SciEval: A Multi-Level Large Language Model Evaluation Benchmark for Scientific Research},
  author = {Liangtai Sun and Yang Han and Zihan Zhao and Da Ma and Zhennan Shen and Baocai Chen and Lu Chen and Kai Yu},
  journal= {arXiv preprint arXiv:2308.13149},
  year   = {2024}
}

备注

12 pages, 17 figures, 12 tables. Accepted by AAAI 2024