中文

EnterpriseOps-Gym:企业环境中用于有状态智能体规划与工具使用的环境和评估

人工智能 2026-03-17 v1 机器学习

摘要

大语言模型正从被动信息提供者转向用于复杂工作流的主动智能体。然而,其作为可靠 AI 工作者在企业中的部署因无法捕捉专业环境复杂性的基准测试而受阻,特别是需要在持续状态变化和严格访问协议下进行长周期规划。在这项工作中,我们引入了 EnterpriseOps-Gym,一个旨在评估企业环境中智能体规划的基准。具体而言,EnterpriseOps-Gym 提供了包含 164 个数据库表和 512 个功能性工具的容器化沙箱,以模拟真实世界的搜索摩擦。在此环境中,智能体在 1,150 个专家策划的任务上进行评估,涵盖八个关键垂直领域(包括客户服务、人力资源和 IT)。我们对 14 个前沿模型的评估揭示了现有模型的关键局限性:表现最好的 Claude Opus 4.5 仅达到 37.4% 的成功率。进一步分析表明,提供神谕式人工计划可将性能提升 14-35 个百分点,定位战略推理为主要瓶颈。此外,智能体经常无法拒绝不可行任务(最佳模型仅达到 53.9%),导致意外且潜在有害的副作用。我们的发现强调当前智能体尚不适合自主企业部署。更广泛地说,EnterpriseOps-Gym 为推进专业工作流中智能体规划的鲁棒性提供了一个具体的测试平台。

关键词

引用

@article{arxiv.2603.13594,
  title  = {EnterpriseOps-Gym: Environments and Evaluations for Stateful Agentic Planning and Tool Use in Enterprise Settings},
  author = {Shiva Krishna Reddy Malay and Shravan Nayak and Jishnu Sethumadhavan Nair and Sagar Davasam and Aman Tiwari and Sathwik Tejaswi Madhusudhan and Sridhar Krishna Nemala and Srinivas Sunkara and Sai Rajeswar},
  journal= {arXiv preprint arXiv:2603.13594},
  year   = {2026}
}