大语言模型在化学领域能做什么?基于八项任务的全面基准评测
计算与语言
2023-12-29 v3 人工智能
摘要
具有强大自然语言处理能力的大语言模型(LLMs)已经出现,并应用于科学、金融和软件工程等多个领域。然而,LLMs 推动化学领域发展的能力仍不明确。在本文中,我们不求达到最先进性能,而是旨在评估 LLMs 在化学领域广泛任务中的能力。我们确定了包括理解、推理和解释在内的三种关键化学相关能力以在 LLMs 中探索,并建立了一个包含八项化学任务的基准。我们的分析借助广泛认可的数据集,促进了对 LLMs 在实际化学背景下能力的广泛探索。五个 LLMs(GPT-4、GPT-3.5、Davinci-003、Llama 和 Galactica)在零样本和少样本上下文学习设定下,使用精心挑选的示例和专门设计的提示,对每项化学任务进行了评估。我们的研究发现 GPT-4 优于其他模型,且 LLMs 在八项化学任务中表现出不同的竞争水平。除全面基准分析的关键发现外,我们的工作还揭示了当前 LLMs 的局限性以及上下文学习设定对 LLMs 在各化学任务中性能的影响。本研究所用的代码和数据集可在 https://github.com/ChemFoundationModels/ChemLLMBench 获取。
引用
@article{arxiv.2305.18365,
title = {What can Large Language Models do in chemistry? A comprehensive benchmark on eight tasks},
author = {Taicheng Guo and Kehan Guo and Bozhao Nan and Zhenwen Liang and Zhichun Guo and Nitesh V. Chawla and Olaf Wiest and Xiangliang Zhang},
journal= {arXiv preprint arXiv:2305.18365},
year = {2023}
}
备注
NeurIPS 2023 Datasets and Benchmarks Track camera-ready version