中文

SciAssess:大语言模型在科学文献分析能力上的基准测试

计算与语言 2024-10-21 v5

摘要

大语言模型(LLM)的最新突破彻底改变了科学文献分析。然而,现有的基准测试未能充分评估 LLM 在该领域的能力,特别是在需要超越单纯记忆的更高层次能力以及处理多模态数据的场景中。针对这一空白,我们引入了 SciAssess,这是一个专门为全面评估 LLM 在科学文献分析中的能力而设计的基准测试。它旨在通过评估 LLM 在记忆(L1)、理解(L2)以及分析与推理(L3)方面的能力,来全面评估其效能。它包含来自生物学、化学、材料和医学等不同科学领域的多种任务。为确保 SciAssess 的可靠性,实施了严格的质量控制措施,以确保准确性、匿名性并符合版权标准。SciAssess 评估了 11 个 LLM,突出了它们的优势和有待改进的领域。我们希望这一评估能支持 LLM 在科学文献分析中应用的持续发展。SciAssess 及其资源可在 \url{https://github.com/sci-assess/SciAssess} 获取。

关键词

引用

@article{arxiv.2403.01976,
  title  = {SciAssess: Benchmarking LLM Proficiency in Scientific Literature Analysis},
  author = {Hengxing Cai and Xiaochen Cai and Junhan Chang and Sihang Li and Lin Yao and Changxin Wang and Zhifeng Gao and Hongshuai Wang and Yongge Li and Mujie Lin and Shuwen Yang and Jiankun Wang and Mingjun Xu and Jin Huang and Xi Fang and Jiaxi Zhuang and Yuqi Yin and Yaqi Li and Changhong Chen and Zheng Cheng and Zifeng Zhao and Linfeng Zhang and Guolin Ke},
  journal= {arXiv preprint arXiv:2403.01976},
  year   = {2024}
}