以系统生物学干实验室衡量语言模型的科学能力
人工智能
2025-07-15 v2
摘要
设计实验和结果解释是生物学等领域的核心科学能力,研究人员通过扰动复杂系统来揭示其背后的机制。近期评估大型语言模型(LLM)科学能力的尝试未能测试这些能力,因为湿实验室实验在专业知识、时间和设备方面的成本过高。我们提出了 SciGym,这是一个首创性的基准测试,旨在评估 LLM 在开放性科学发现任务中的迭代实验设计和分析能力。SciGym 通过构建生物系统的干实验室来克服湿实验室成本的挑战。这些模型以 Systems Biology Markup Language 编码,适合生成模拟数据,成为复杂系统实验的理想测试场。我们在 137 个小系统上评估了六个前沿 LLM,并发布了 350 个系统。我们的评估显示,尽管更具能力的模型表现出优异的性能,但所有模型的性能随系统复杂度的增加而显著下降,表明在 LLM 代理的科学能力方面仍有很大的提升空间。
引用
@article{arxiv.2507.02083,
title = {Measuring Scientific Capabilities of Language Models with a Systems Biology Dry Lab},
author = {Haonan Duan and Stephen Zhewen Lu and Caitlin Fiona Harrigan and Nishkrit Desai and Jiarui Lu and Michał Koziarski and Leonardo Cotta and Chris J. Maddison},
journal= {arXiv preprint arXiv:2507.02083},
year = {2025}
}