面向智能体系统规模化的科学
人工智能
2026-04-10 v3
摘要
智能体(Agent)是能够进行推理、规划和行动的语言模型驱动系统,已在实际任务中广泛采用,但其性能随规模在关键维度上的变化方式仍鲜有探讨。我们引入量化规模原则,以预测模型捕获性能随协调、模型能力以及可测量系统与任务因素变化的规模关系。我们在260个配置中进行了受控评估,覆盖六个智能体基准、五个经典架构(单智能体与四个多智能体:Independent、Centralized、Decentralized、Hybrid),以及三个LLM系列。我们标准化了工具、提示和计算,以隔离架构效应。得到的模型在所有六个基准上实现了交叉验证R²=0.373(使用基于任务的能力指标为0.413)。我们识别出稳健的能力饱和效应,以及额外模式:(1)协调一旦单智能体基线超过一定性能,便产生报酬递减;(2)工具密集型任务似乎产生多智能体开销;(3)缺乏集中式验证的架构比具有集中式协调的架构更容易传播错误。相对于单智能体基线的相对性能变化范围从在可分解财务推理中+80.8%到在顺序规划中-70.0%,表明架构与任务的匹配度决定了协作成功。该框架为87%的 held-out配置识别最佳架构,并显示在未见的前沿模型上保持一致的相对架构偏好。智能体的有效性取决于协调与任务结构之间的匹配度,失配的协调会损害性能。
引用
@article{arxiv.2512.08296,
title = {Towards a Science of Scaling Agent Systems},
author = {Yubin Kim and Ken Gu and Chanwoo Park and Chunjong Park and Samuel Schmidgall and A. Ali Heydari and Yao Yan and Zhihan Zhang and Yuchen Zhuang and Yun Liu and Mark Malhotra and Paul Pu Liang and Hae Won Park and Yuzhe Yang and Xuhai Xu and Yilun Du and Shwetak Patel and Tim Althoff and Daniel McDuff and Xin Liu},
journal= {arXiv preprint arXiv:2512.08296},
year = {2026}
}