中文

从基准测试到业务影响:IBM通用智能体在企业生产环境中的部署

人工智能 2025-12-10 v2

摘要

智能体在自动化数字工作方面正迅速发展,但企业面临的更艰巨挑战在于:超越原型,部署能够交付可衡量业务价值的系统。这一路径受限于框架碎片化、开发缓慢以及缺乏标准化评估实践。通用智能体作为一种有前景的方向,已在学术基准测试中取得优异成绩,并在任务类型、应用和模态方面提供灵活性。然而,其在生产企业环境中的实际应用证据仍有限。本文报告了IBM开发和试点通用计算机智能体(CUGA)的经验,该系统已开源(https://github.com/cuga-project/cuga-agent)。CUGA采用具有强大分析基础的分层规划-执行架构,在AppWorld和WebArena上实现了最先进的性能。超越基准测试,它在业务-流程- Outsourcing人才招聘领域进行了评估,满足企业对可扩展性、可审计性、安全性和治理的要求。为支持评估,我们引入了BPO-TA——一个覆盖13个分析端点的26任务基准。在初步评估中,CUGA接近专用智能体的准确率,同时表明其潜在可减少开发时间和成本。我们的贡献有两个:首次呈现通用智能体在企业规模下运行的初步证据,以及从此初始试点中提炼的技术和组织经验教训。我们概述了推动研究级架构如CUGA迈向稳健、企业就绪系统的要求和下一步工作。

关键词

引用

@article{arxiv.2510.23856,
  title  = {From Benchmarks to Business Impact: Deploying IBM Generalist Agent in Enterprise Production},
  author = {Segev Shlomov and Alon Oved and Sami Marreed and Ido Levy and Offer Akrabi and Avi Yaeli and Łukasz Strąk and Elizabeth Koumpan and Yinon Goldshtein and Eilam Shapira and Nir Mashkif and Asaf Adi},
  journal= {arXiv preprint arXiv:2510.23856},
  year   = {2025}
}

备注

AAAI Conference on Artificial Intelligence