大型语言模型是否是超越人类的化学家?
机器学习
2024-11-04 v2 材料科学
人工智能
化学物理
摘要
大型语言模型(LLM)因其处理人类语言的能力以及在非显式训练任务上的表现而广受关注。然而,我们仅对 LLM 的化学能力拥有有限的系统性理解,这需要以改进模型、缓解潜在风险为前提。本文引入了“ChemBench”,一个用于评估领先开源和闭源 LLM 在化学知识与推理能力方面是否超过化学家专家的自动化框架。我们精选了超过 2700 组问答对,评估了主要的开源和闭源 LLM,发现最佳模型在本研究中平均超过最佳人类化学家。然而,这些模型在某些基础任务上仍感到困难,并提供了过于自信的预测。这些发现揭示了 LLM 在化学领域的惊人能力,同时强调了为提高其安全性和实用性而需进一步研究的必要性。它们还表明需要调整化学教育,并凸显了评估框架在特定领域中评估 LLM 的价值。
引用
@article{arxiv.2404.01475,
title = {Are large language models superhuman chemists?},
author = {Adrian Mirza and Nawaf Alampara and Sreekanth Kunchapu and Martiño Ríos-García and Benedict Emoekabu and Aswanth Krishnan and Tanya Gupta and Mara Schilling-Wilhelmi and Macjonathan Okereke and Anagha Aneesh and Amir Mohammad Elahi and Mehrdad Asgari and Juliane Eberhardt and Hani M. Elbeheiry and María Victoria Gil and Maximilian Greiner and Caroline T. Holick and Christina Glaubitz and Tim Hoffmann and Abdelrahman Ibrahim and Lea C. Klepsch and Yannik Köster and Fabian Alexander Kreth and Jakob Meyer and Santiago Miret and Jan Matthias Peschel and Michael Ringleb and Nicole Roesner and Johanna Schreiber and Ulrich S. Schubert and Leanne M. Stafast and Dinga Wonanke and Michael Pieler and Philippe Schwaller and Kevin Maik Jablonka},
journal= {arXiv preprint arXiv:2404.01475},
year = {2024}
}