LLM Agent 系统技能的扩展规律
计算与语言
2026-05-19 v1 人工智能
摘要
随着代理系统的规模扩大,技能会累积成大型可重用库,但其扩展规律仍不完全理解。我们在15个前沿大语言模型、1141个真实世界技能以及超过300万路由或执行决策中,确定了两个耦合的规律。路由规律:单步路由准确率随库大小对数衰减(),错误从局部技能竞争转为跨族漂移和被过于宽泛的“黑洞技能”捕获。执行规律:在状态实现之前,联合路由约为乘法,而正确执行可使困难的下游决策约提高。一个参数——路由对数衰减斜率——耦合了这两个规律:路由侧拟合预测了执行侧的拯救,表明相同的库属性控制了执行前的崩溃以及下游的可恢复性。这些规律是可操作的:依据规律导向的优化将 held-out路由准确率从71.3%提升至91.7%,将劫持率从22.4%降至4.1%,并在下游ClawBench和ClawMark执行设置中实现方向性迁移,将ClawBench的平均通过率从49.3%提升至61.6%,将ClawMark的平均通过率从28.4%提升至34.5%。这些结果表明,代理系统的性能不仅取决于模型能力,还取决于技能库的结构、粒度和暴露策略。
引用
@article{arxiv.2605.16508,
title = {The Scaling Laws of Skills in LLM Agent Systems},
author = {Charles Chen and Qiming Yu and Yuhang Gu and Zhuoye Huang and Hanjing Li and Hongyu Liu and Simin Liu and Jinhao Liu and Dengyun Peng and Jiangyi Wang and Zheng Yan and Fanqing Meng and Ethan Qin and Carl Che and Mengkang Hu},
journal= {arXiv preprint arXiv:2605.16508},
year = {2026}
}
备注
Technical Report