通过大型语言模型增强的化学计算验证科学文献
人工智能
2024-10-10 v1 计算与语言
信息检索
摘要
化学计算是指利用通用符号语言编程化学机器人以执行实验的过程,但文献可能因歧义而容易出错且难以阅读。大型语言模型 (LLM) 在自然语言处理、机器人控制等多个领域展现出惊人的能力,近期亦在化学领域取得显著进展。尽管在标准化报告和收集合成化学数据方面取得了显著进展,但自动复现已报告合成程序仍是一项耗时的任务。本文引入一种基于 LLM 的化学研究代理工作流程,用于自动验证合成文献中的程序。我们的工作流程能够自主从大量文档中提取合成程序和分析数据,将这些程序翻译为通用的 XDL 代码,在硬件特定的设置下模拟执行该程序,并最终在受 XDL 控制的化学机器人系统上执行合成程序。这一工作流程的实际应用,展示了基于 LLM 的工作流程在具有机器人驱动的合成化学研究中的自主潜力。由于 XDL 的抽象化,该方法在安全性、可验证性和可扩展性方面表现出色,因为幻觉不会导致化学不可实现,XDL 代码可被验证和加密。与以往工作相比,我们的方法提供了四个来自合成文献的真实合成实例。我们预计,该工作流程将显著提升机器人驱动的合成化学研究中的自动化程度, streamlining 数据提取,提高实验和合成化学的可重复性、可扩展性和安全性。
引用
@article{arxiv.2410.06384,
title = {Validation of the Scientific Literature via Chemputation Augmented by Large Language Models},
author = {Sebastian Pagel and Michael Jirasek and Leroy Cronin},
journal= {arXiv preprint arXiv:2410.06384},
year = {2024}
}
备注
22 pages, 7 figures, 34 references