中文

面向复合人工智能系统的可扩展推理架构:一项生产部署研究

人工智能 2026-04-29 v1

摘要

现代企业人工智能应用日益依赖于复合人工智能系统——即组合多个模型、检索器和工具以完成复杂任务的架构。在生产环境中部署此类系统要求推理基础设施能够在保持成本效益和低延迟的同时,高效地服务于并发的、异构的模型调用。本文介绍了在 Salesforce 开发的一种模块化、平台无关的推理架构的生产部署研究,该架构旨在支持包括 Agentforce(自主人工智能代理)和 ApexGuru(人工智能驱动的代码分析)在内的复合人工智能用例。该系统集成了无服务器执行、动态自动伸缩和 MLOps 管道,以在多组件代理工作流中提供一致的低延迟推理。我们报告的生产结果显示,与先前的静态部署相比,尾部延迟(P95)降低了 50% 以上,吞吐量提升了高达 3.9 倍,成本节省了 30% 至 40%。我们进一步对复合系统特有的挑战进行了新颖分析,包括在服务代理工作负载时独特出现的多模型扇出开销、级联冷启动传播和异构伸缩动态。通过详细的案例研究和运维经验,我们阐明了该架构如何使复合人工智能系统能够并行扩展模型调用、处理突发性的多代理工作负载,并支持快速模型迭代——这些能力对于在企业规模上实现代理人工智能的运营化至关重要。

关键词

引用

@article{arxiv.2604.25724,
  title  = {Scalable Inference Architectures for Compound AI Systems: A Production Deployment Study},
  author = {Srikanta Prasad S and Utkarsh Arora},
  journal= {arXiv preprint arXiv:2604.25724},
  year   = {2026}
}

备注

Accepted to the ACM Conference on AI and Agentic Systems (ACM CAIS 2026)