中文

从大型语言模型提炼化学反应贝叶斯优化的定量洞见

机器学习 2025-04-15 v1 人工智能

摘要

机器学习和贝叶斯优化 (BO)算法可显著加速化学反应优化。迁移学习可通过利用已有化学信息或优化任务之外的数据(即源数据)来强化BO算法在数据稀缺情形下的效果。大型语言模型 (LLM)已显示,基础训练数据中蕴含的化学信息可为其处理化学数据提供效用。此外,它们还能辅助合成与优化任务相关的多模态化学数据的潜在来源。本文考察了如何从LLM中提取化学信息并用于迁移学习,以加速反应条件的BO以最大化产率。具体而言,我们表明,调查式提示方案和偏好学习可用于推断模型LLM中嵌入的化学信息在化学参数空间上的效用函数;我们发现,该效用函数虽在零样本情形下,却与参数空间上真实实验测量值(产率)呈现适度相关性。进一步,我们表明该效用函数可用于聚焦有前景参数空间的BO effort,提高初始BO查询产率,并在研究的6个数据集中提升优化效果。总体而言,我们视本工作为连接LLM中蕴含的化学知识与原则化BO方法加速反应优化能力之间的桥梁。

关键词

引用

@article{arxiv.2504.08874,
  title  = {Distilling and exploiting quantitative insights from Large Language Models for enhanced Bayesian optimization of chemical reactions},
  author = {Roshan Patel and Saeed Moayedpour and Louis De Lescure and Lorenzo Kogler-Anele and Alan Cherney and Sven Jager and Yasser Jangjou},
  journal= {arXiv preprint arXiv:2504.08874},
  year   = {2025}
}