中文

CORE-Bench:通过计算可复现性智能体基准测试提升已发表研究的可信度

计算与语言 2024-09-18 v1 人工智能 多智能体系统

摘要

AI 智能体有潜力在各种重要任务中辅助用户,包括进行科学研究。为了促进有用智能体的开发,我们需要具有挑战性,但更关键的是,能直接对应现实世界感兴趣任务的基准测试。本文介绍了这样一个基准,旨在衡量 AI 智能体在解决科学研究中一个至关重要但出奇困难方面的准确性:计算可复现性。这项任务是科学过程的基础,涉及使用提供的代码和数据复现研究结果。我们引入了 CORE-Bench(计算可复现性智能体基准测试),这是一个由 270 个任务组成的基准,这些任务基于三个学科(计算机科学、社会科学和医学)的 90 篇科学论文。CORE-Bench 中的任务包含三个难度级别,并包括纯语言和视觉语言任务。我们提供了一个评估系统,以快速且可并行的方式衡量智能体的准确性,与顺序实现相比,每次运行可节省数天的评估时间。我们评估了两个基线智能体:通用型 AutoGPT 和一个名为 CORE-Agent 的特定任务智能体。我们使用两种底层语言模型测试了这两种变体:GPT-4o 和 GPT-4o-mini。表现最佳的智能体在最难的任务上达到了 21% 的准确率,这表明在自动化常规科学任务方面还有巨大的改进空间。拥有能够复现现有工作的智能体,是构建能够进行新颖研究并可能验证和改进其他研究智能体性能的智能体的必要步骤。我们希望 CORE-Bench 能够提升可复现性的现状,并促进未来研究智能体的发展。

关键词

引用

@article{arxiv.2409.11363,
  title  = {CORE-Bench: Fostering the Credibility of Published Research Through a Computational Reproducibility Agent Benchmark},
  author = {Zachary S. Siegel and Sayash Kapoor and Nitya Nagdir and Benedikt Stroebl and Arvind Narayanan},
  journal= {arXiv preprint arXiv:2409.11363},
  year   = {2024}
}

备注

Benchmark harness and code available at http://github.com/siegelz/core-bench