中文

RE-Bench:评估面向人类专家的前沿 AI R&D 能力的语言模型代理

机器学习 2025-05-28 v2 人工智能

摘要

前沿 AI 安全政策强调自动化 AI 研究和开发 (R&D) 通过 AI 代理实现,这是一个重要的能力。然而,目前几乎没有针对 AI R&D 能力的评估,而且没有任何评估是高度真实且具有直接的人类性能比较。我们引入 RE-Bench (Research Engineering Benchmark, v1),其中包含 7 个具有挑战性的、开放性的 ML 研究工程环境,以及来自 61 位不同人类专家 8 小时尝试的 71 个数据集。我们确认专家在给定 8 小时后在这些环境中取得进展,82% 的专家尝试获得非零分数,24% 的尝试达到或超过我们的强参考解决方案。我们将人类与几个公开的前沿模型进行比较,通过 best-of-k 进行比较,时间预算和代理设计各不相同,我们发现最佳 AI 代理在给定总时间预算为 2 小时/环境时,得分比人类专家高出 4 倍。然而,人类目前在增加时间预算方面表现更好,仅在给定 8 小时预算后就超过了最佳 AI 代理得分,两者都给定 32 小时预算后,人类得分是最佳 AI 代理的 2 倍。定性地,我们发现现代 AI 代理在许多 ML 主题方面都具有显著的专业知识——例如,一个代理编写的自定义 Triton 内核比我们的所有人类专家都要快——并且比人类快十倍地生成和测试解决方案,成本更低。我们开源了评估环境、人类专家数据、分析代码和代理轨迹,以促进未来研究。

关键词

引用

@article{arxiv.2411.15114,
  title  = {RE-Bench: Evaluating frontier AI R&D capabilities of language model agents against human experts},
  author = {Hjalmar Wijk and Tao Lin and Joel Becker and Sami Jawhar and Neev Parikh and Thomas Broadley and Lawrence Chan and Michael Chen and Josh Clymer and Jai Dhyani and Elena Ericheva and Katharyn Garcia and Brian Goodrich and Nikola Jurkovic and Holden Karnofsky and Megan Kinniment and Aron Lajko and Seraphina Nix and Lucas Sato and William Saunders and Maksym Taran and Ben West and Elizabeth Barnes},
  journal= {arXiv preprint arXiv:2411.15114},
  year   = {2025}
}