中文

LLM-AutoSciLab:通过 LLM 主动实验发现的闭环科学发现

机器学习 2026-05-26 v1 人工智能

摘要

科学发现是一个闭环过程,其中假设引导数据获取,观察结果细化假设空间。然而,大多数方法将发现简化为对固定数据集的监督学习,受限于的观察只能支持多个局部符合但难以概括的可能机制。因此,关键挑战在于选择信息丰富的观察来消除不确定性,将焦点从静态推断转向自适应数据获取。为此,我们提出 LLM-AutoSciLab,一个将假设生成与假设条件实验选择相结合的闭环框架,进而进行机制细化。与在被动收集的数据上拟合模型不同,LLM-AutoSciLab 迭代提出合理的假设,选择以区分或细化这些假设的有信息实验,并根据所得证据更新其状态。为评估具有动态闭环科学发现的主动数据获取能力,我们引入 ActiveSciBench,包含两个数据集:ActiveSciBench-Chem 包含 57 个酶动力学任务,ActiveSciBench-GRN 包含 45 个基因调控网络任务。这些数据集将发现建模为受预算约束的过程,要求进行自适应实验设计、变量选择和恢复真实机制。跨越 NewtonBench、ActiveSciBench-Chem 和 ActiveSciBench-GRN,LLM-AutoSciLab 在所有数据集上均优于先前方法,NewtonBench 和 ActiveSciBench-Chem 分别实现 67.6% 和 35.1% 的符号精度,ActiveSciBench-GRN 实现 31.1% 的精确图恢复。此外,基于假设的实验方法在样本效率上优于最强的竞争基线 2-5 倍。代码和数据已公开于:https://github.com/scientific-discovery/LLM-AutoSciLab

关键词

引用

@article{arxiv.2605.24043,
  title  = {LLM-AutoSciLab: Closed-Loop Scientific Discovery via Active Experimentation with LLMs},
  author = {Sanchit Kabra and Nikhil Abhyankar and Saaketh Desai and Prasad Iyer and Chandan K Reddy},
  journal= {arXiv preprint arXiv:2605.24043},
  year   = {2026}
}