科学发现中的大语言模型评估
人工智能
2026-05-11 v2 材料科学
机器学习
化学物理
摘要
大语言模型(LLMs)日益被应用于科学研究,但现有的科学基准测试探讨的是去上下文化的知识,忽略了驱动科学发现的迭代推理、假设生成和观察解释。我们引入一个以情境为导向的基准测试,在生物学、化学、材料和物理学领域评估LLMs,其中领域专家定义真实意义的研究项目,并将其分解为模块化的研究情境,从中抽取经审核的问题。该框架在两个层面上评估模型:(i)针对情境关联项目的准确率,(ii)项目级性能,其中模型必须提出可检验的假设、设计仿真或实验并解释结果。将这个两阶段科学发现评估(SDE)框架应用于最先进的LLMs,揭示了其与通用科学基准测试相比表现出显著差距,放大模型规模和推理能力的报酬递减,以及来自不同提供商的顶级模型共享的系统性弱点。研究情境中的显著性能差异导致不同情境下表现最佳模型的选择变化,表明当前的LLMs距离通用科学“超智能”仍有很大的距离。尽管如此,LLMs已经在大量科学发现项目中展现出前景,包括那些常数情境得分较低的案例,凸显了引导探索和偶然性在发现中的作用。该SDE框架为发现相关的LLM评估提供了可复现的基准测试,并为推动其发展以通向科学发现的方向提供了实用路径。
引用
@article{arxiv.2512.15567,
title = {Evaluating Large Language Models in Scientific Discovery},
author = {Zhangde Song and Jieyu Lu and Yuanqi Du and Botao Yu and Thomas M. Pruyn and Yue Huang and Kehan Guo and Xiuzhe Luo and Yuanhao Qu and Yi Qu and Yinkai Wang and Haorui Wang and Jeff Guo and Jingru Gan and Parshin Shojaee and Di Luo and Andres M Bran and Gen Li and Qiyuan Zhao and Shao-Xiong Lennon Luo and Yuxuan Zhang and Xiang Zou and Wanru Zhao and Yifan F. Zhang and Wucheng Zhang and Shunan Zheng and Saiyang Zhang and Sartaaj Takrim Khan and Mahyar Rajabi-Kochi and Samantha Paradi-Maropakis and Tony Baltoiu and Fengyu Xie and Tianyang Chen and Kexin Huang and Weiliang Luo and Meijing Fang and Xin Yang and Lixue Cheng and Jiajun He and Soha Hassoun and Xiangliang Zhang and Wei Wang and Chandan K. Reddy and Chao Zhang and Zhiling Zheng and Mengdi Wang and Le Cong and Carla P. Gomes and Chang-Yu Hsieh and Aditya Nandy and Philippe Schwaller and Heather J. Kulik and Haojun Jia and Huan Sun and Seyed Mohamad Moosavi and Chenru Duan},
journal= {arXiv preprint arXiv:2512.15567},
year = {2026}
}