SciPredict:大语言模型能否预测自然科学实验的结果?
人工智能
2026-04-14 v1
摘要
加速科学发现需要在投入资源进行昂贵的物理验证之前,确定哪些实验能产生最佳结果。虽然现有基准评估LLM在科学知识和推理方面的能力,但它们预测实验结果的能力——一个AI可能显著超越人类能力的任务——在很大程度上仍未得到充分探索。我们引入了SciPredict,一个包含405个任务的基准,这些任务源自物理学、生物学和化学33个专业子领域的最新实证研究。SciPredict解决了两个关键问题:(a) LLM能否以足够的准确性预测科学实验的结果?(b) 这样的预测能否可靠地用于科学研究过程?评估揭示了在这两方面的根本局限性。模型准确率为14-26%,人类专家表现约为20%。尽管一些前沿模型超过了人类表现,但模型准确率仍然远低于能够提供可靠实验指导的水平。即使在有限的性能范围内,模型也无法区分可靠和不可靠的预测,无论其置信度如何,或者它们是否判断结果无需物理实验即可预测,准确率都只有约20%。相比之下,人类专家表现出强大的校准能力:随着他们认为结果无需进行实验即可预测的程度增加,他们的准确率从约5%上升到约80%。SciPredict建立了一个严格的框架,证明在实验科学中超越人类的表现不仅需要更好的预测,还需要对预测可靠性有更好的认识。为了可重复性,我们的所有数据和代码均可在https://github.com/scaleapi/scipredict获取。
引用
@article{arxiv.2604.10718,
title = {SciPredict: Can LLMs Predict the Outcomes of Scientific Experiments in Natural Sciences?},
author = {Udari Madhushani Sehwag and Elaine Lau and Haniyeh Ehsani Oskouie and Shayan Shabihi and Erich Liang and Andrea Toledo and Guillermo Mangialardi and Sergio Fonrouge and Ed-Yeremai Hernandez Cardona and Paula Vergara and Utkarsh Tyagi and Chen Bo Calvin Zhang and Pavi Bhatter and Nicholas Johnson and Furong Huang and Ernesto Gabriel Hernandez Montoya and Bing Liu},
journal= {arXiv preprint arXiv:2604.10718},
year = {2026}
}