中文

TheAgentCompany:在重大现实世界任务上对 LLM 智能体进行基准测试

计算与语言 2025-09-11 v3

摘要

我们每天都在与计算机交互,无论是在日常生活中还是在工作中,并且工作的许多方面都可以仅通过访问计算机和互联网来完成。与此同时,得益于大语言模型 (LLM) 的改进,在与周围环境交互并对其产生影响的 AI 智能体方面也取得了快速发展。但是,AI 智能体在加速甚至自主执行与工作相关的任务方面表现如何?这个问题的答案对于希望将 AI 采纳到其工作流程中的行业以及对于理解 AI 采纳可能对劳动力市场产生的经济政策都具有重要意义。为了衡量这些 LLM 智能体在执行现实世界专业任务上的性能进展,在本文中我们介绍了 TheAgentCompany,这是一个用于评估 AI 智能体的可扩展基准,这些智能体以类似于数字工作者的方式与世界交互:通过浏览网页、编写代码、运行程序以及与其他同事交流。我们构建了一个包含内部网站和数据的自包含环境,模拟了一家小型软件公司的环境,并创建了此类公司中工作人员可能执行的各种任务。我们测试了由闭源基于 API 和开源权重语言模型 (LM) 驱动的基线智能体,发现最具竞争力的智能体可以自主完成 30% 的任务。这描绘了一幅使用 LM 智能体进行任务自动化的细致图景——在模拟真实工作场所的设置中,很大一部分较简单的任务可以被自主解决,但更困难的长期任务仍然超出了当前系统的能力范围。我们在 https://the-agent-company.com 上发布了代码、数据、环境和实验。

关键词

引用

@article{arxiv.2412.14161,
  title  = {TheAgentCompany: Benchmarking LLM Agents on Consequential Real World Tasks},
  author = {Frank F. Xu and Yufan Song and Boxuan Li and Yuxuan Tang and Kritanjali Jain and Mengxue Bao and Zora Z. Wang and Xuhui Zhou and Zhitong Guo and Murong Cao and Mingyang Yang and Hao Yang Lu and Amaad Martin and Zhe Su and Leander Maben and Raj Mehta and Wayne Chi and Lawrence Jang and Yiqing Xie and Shuyan Zhou and Graham Neubig},
  journal= {arXiv preprint arXiv:2412.14161},
  year   = {2025}
}

备注

Preprint