MOOSE-Chem:大语言模型用于红现代未发现的化学科学假设
计算与语言
2025-10-28 v6 人工智能
机器学习
摘要
科学发现在推动人类社会发展中占据关键作用,近期在大语言模型(LLMs)方面的进展表明其有潜力加速这一过程。然而,是否可以让 LLMs 在仅凭研究背景(包括问题和/或调查)的情况下自主生成新颖且有效的化学假设,尚不明确。本文我们探讨 LLMs 是否能在给定研究背景(而不限制于问题领域)的情况下发现高质量的化学假设。我们首先观察到,假设发现是一个看似不可行的任务。为此,我们提出一种基于基本假设的数学分解:即大多数化学假设可以由研究背景和一组灵感组成。这一分解导致三个实际子任务——检索灵感、利用灵感组合假设、对假设进行排序——构成整个科学发现任务的充分子任务集合。我们进一步开发了一个基于 LLM 的代理框架,MOOSE-Chem,是该数学分解的直接实现。为评估该框架,我们构建了一个由 51 篇 2024 年 1 月之后发布的高影响力化学论文组成的基准数据集,每篇论文均由博士化学家手动标注了背景、灵感和假设。该框架能够以高度相似度重新发现许多假设,成功捕捉到核心创新,同时确保无数据污染,因为其使用的 LLM 知识截止日期早于 2024 年。最后,基于 LLMs 在灵感检索方面出奇制胜的高准确率——这一具有本质离散特性的任务——我们提出一种大胆假设:LLMs 可能已经编码了人类尚未认识的潜在科学知识关联。
引用
@article{arxiv.2410.07076,
title = {MOOSE-Chem: Large Language Models for Rediscovering Unseen Chemistry Scientific Hypotheses},
author = {Zonglin Yang and Wanhao Liu and Ben Gao and Tong Xie and Yuqiang Li and Wanli Ouyang and Soujanya Poria and Erik Cambria and Dongzhan Zhou},
journal= {arXiv preprint arXiv:2410.07076},
year = {2025}
}
备注
Accepted by ICLR 2025