中文

ScienceAgentBench:面向数据驱动科学发现的语言智能体严格评估

计算与语言 2025-04-01 v3 人工智能 机器学习

摘要

大语言模型(LLM)的快速发展催生了开发LLM-based语言智能体以端到端自动化科学发现的热潮,这既激发了对其真实能力的期待,也引发了质疑。本文呼吁在作出关于端到端自动化的大胆论断之前,对智能体在科学工作流程中的各个任务进行严格评估。为此,我们提出ScienceAgentBench,这是一个用于评估语言智能体数据驱动科学发现的新基准。为确保基准的科学真实性和现实相关性,我们从四个学科领域的44篇同行评议出版物中提取102个任务,并邀请九位领域专家进行验证。我们将每个任务的目标输出统一格式化为自包含的Python程序文件,并采用多种评估指标检查生成的程序、执行结果及成本。每个任务经过多个轮次的注释员和领域专家的手动验证,确保标注质量和科学可行性。我们还提出两种有效策略来缓解数据污染 concerns。使用ScienceAgentBench,我们评估了五个开源和专有LLM,每个模型使用三个框架:直接提示、OpenHands CodeAct和自我调试。在每个任务中给出三次尝试机会,最佳表现的智能体仅能独立解决32.4%的任务,辅以专家提供知识可解决34.3%。此外,我们评估了OpenAI o1-preview使用直接提示和自我调试,性能提升至42.2%,显示了增加推理计算的有效性,但比其他LLM高出十倍以上成本。尽管如此,我们的结果仍凸显当前语言智能体在生成数据驱动发现代码方面的局限性,更别提实现科学研究的端到端自动化了。

关键词

引用

@article{arxiv.2410.05080,
  title  = {ScienceAgentBench: Toward Rigorous Assessment of Language Agents for Data-Driven Scientific Discovery},
  author = {Ziru Chen and Shijie Chen and Yuting Ning and Qianheng Zhang and Boshi Wang and Botao Yu and Yifei Li and Zeyi Liao and Chen Wei and Zitong Lu and Vishal Dey and Mingyi Xue and Frazier N. Baker and Benjamin Burns and Daniel Adu-Ampratwum and Xuhui Huang and Xia Ning and Song Gao and Yu Su and Huan Sun},
  journal= {arXiv preprint arXiv:2410.05080},
  year   = {2025}
}

备注

ICLR 2025. 60 pages