ChemEval:面向大型语言模型的全面多层级化学评估
计算与语言
2024-09-24 v1 人工智能
机器学习
化学物理
生物大分子
摘要
人们对 LLM 在化学领域所扮演角色的兴趣日益浓厚,这促使人们越来越关注开发针对化学领域的 LLM 基准,以评估 LLM 在类型和复杂程度各异的化学任务上的表现。然而,该领域现有的基准未能充分满足化学研究专业人员的特定需求。为此,我们提出 \textbf{\textit{ChemEval}},它对 LLM 在广泛化学领域任务上的能力提供全面评估。具体而言,ChemEval 确定了化学领域 4 个关键的递进层级,评估了跨越 42 项不同化学任务的 12 个 LLM 维度,这些任务的数据源自开源数据以及化学专家精心制作的数据,确保任务具有实用价值并能有效评估 LLM 的能力。在实验中,我们在零样本和少样本学习情境下使用 ChemEval 评估了 12 个主流 LLM,其中包括精心挑选的演示示例和精心设计的提示。结果表明,尽管 GPT-4 和 Claude-3.5 等通用 LLM 在文献理解和指令遵循方面表现出色,但它们在需要高级化学知识的任务上表现不佳。相反,专门的 LLM 展现出更强的化学能力,尽管其文献理解能力有所下降。这表明 LLM 在处理化学领域的复杂任务时具有巨大的提升潜力。我们相信我们的工作将促进探索其推动化学发展的潜力。我们的基准和分析将在 {\color{blue} \url{https://github.com/USTC-StarTeam/ChemEval}} 提供。
引用
@article{arxiv.2409.13989,
title = {ChemEval: A Comprehensive Multi-Level Chemical Evaluation for Large Language Models},
author = {Yuqing Huang and Rongyang Zhang and Xuesong He and Xuyang Zhi and Hao Wang and Xin Li and Feiyang Xu and Deguang Liu and Huadong Liang and Yi Li and Jian Cui and Zimu Liu and Shijin Wang and Guoping Hu and Guiquan Liu and Qi Liu and Defu Lian and Enhong Chen},
journal= {arXiv preprint arXiv:2409.13989},
year = {2024}
}