PaperBench:评估AI代理复制AI研究能力的基准
人工智能
2025-04-08 v3 计算与语言
摘要
我们提出了PaperBench,这是一个评估AI代理复制最先进AI研究能力的基准测试。代理必须从零复制20篇ICML 2024聚光灯和口头报告论文,包括理解论文贡献、开发代码库并成功执行实验。为进行客观评估,我们开发了分层分解每个复制任务为更小子任务的评分标准。总体而言,PaperBench包含8,316个可单独评分的任务。评分标准由ICML论文作者共同开发,以确保准确性和真实性。为实现可扩展评估,我们还开发了基于LLM的评判器,用于自动根据评分标准对复制尝试进行评分,并通过创建独立的评判器基准来评估评判器性能。我们对PaperBench上的几款前沿模型进行了评估,发现表现最佳的测试代理——Claude 3.5 Sonnet(新版本)配合开源脚手架,平均复制得分达21.0%。最后,我们邀请顶尖ML博士参与PaperBench的一部分测试,发现模型尚未超过人类基准。我们开源代码(https://github.com/openai/preparedness)以推动未来研究,理解AI代理的AI工程能力。
引用
@article{arxiv.2504.01848,
title = {PaperBench: Evaluating AI's Ability to Replicate AI Research},
author = {Giulio Starace and Oliver Jaffe and Dane Sherburn and James Aung and Jun Shern Chan and Leon Maksin and Rachel Dias and Evan Mays and Benjamin Kinsella and Wyatt Thompson and Johannes Heidecke and Amelia Glaese and Tejal Patwardhan},
journal= {arXiv preprint arXiv:2504.01848},
year = {2025}
}
备注
30 pages, 14 figures