中文

评估大型语言模型的化学智能

机器学习 2025-07-14 v2

摘要

大型语言模型是一种多用途的、通用工具,具有广泛的应用范围。最近,“推理模型”的出现导致其在数学和软件工程等高级问题解决领域的能力得到显著提升。本文评估了推理模型在不依赖外部工具的情况下执行化学任务的能力。我们创建了一个新基准测试,称为 ChemIQ,包含 816 个问题,用于评估有机化学核心概念,专注于分子理解和化学推理。与以往基准测试不同,后者主要使用多选格式,而本方法要求模型构建简短的答复,更贴近实际应用。推理模型,包括 OpenAI 的 o3-mini、Google 的 Gemini Pro 2.5 和 DeepSeek R1,在最高推理模式下,对 816 个问题的正确率为 50%-57%,而在所有任务上,更高的推理水平显著提升了性能。这些模型在非推理模型上实现了显著优势,非推理模型仅实现 3%-7% 的准确率。我们发现,大型语言模型现在可以将 SMILES 字符串转换为 IUPAC 名称,这是以前模型无法完成的任务。此外,我们展示了最新的推理模型能够从 1D 和 2D 1H 和 13C NMR 数据中阐明结构,Gemini Pro 2.5 在约 90% 包含最多 10 个重原子的分子中正确生成 SMILES 字符串,并在一个包含 25 个重原子的结构中取得成功。对于每项任务,我们发现推理过程类似于人类化学家的推理过程。我们的结果表明,最新的推理模型在某些情况下可以进行高级化学推理。

关键词

引用

@article{arxiv.2505.07735,
  title  = {Assessing the Chemical Intelligence of Large Language Models},
  author = {Nicholas T. Runcie and Charlotte M. Deane and Fergus Imrie},
  journal= {arXiv preprint arXiv:2505.07735},
  year   = {2025}
}