中文

APEX-Agents

计算与语言 2026-02-24 v3 人工智能 机器学习

摘要

我们引入了AI代理生产力指数(APEX-Agents),这是一个基准测试,用于评估AI代理能否执行由投资银行分析师、管理顾问和公司律师创建的长期、跨应用任务。APEX-Agents要求代理在包含文件和工具的现实工作环境中导航。我们使用Pass@1测试了排行榜上的八个代理。Gemini 3 Flash(Thinking=High)以24.0%的最高分位居榜首,其次是GPT-5.2(Thinking=High)、Claude Opus 4.5(Thinking=High)和Gemini 3 Pro(Thinking=High)。我们开源了APEX-Agents基准测试(n=480),包含所有提示、评分标准、标准输出、文件和元数据。我们还开源了Archipelago,这是我们用于代理执行和评估的基础设施。

关键词

引用

@article{arxiv.2601.14242,
  title  = {APEX-Agents},
  author = {Bertie Vidgen and Austin Mann and Abby Fennelly and John Wright Stanly and Lucas Rothman and Marco Burstein and Julien Benchek and David Ostrofsky and Anirudh Ravichandran and Debnil Sur and Neel Venugopal and Alannah Hsia and Isaac Robinson and Calix Huang and Olivia Varones and Daniyal Khan and Michael Haines and Austin Bridges and Jesse Boyle and Koby Twist and Zach Richards and Chirag Mahapatra and Brendan Foody and Osvald Nitski},
  journal= {arXiv preprint arXiv:2601.14242},
  year   = {2026}
}