将 Agentic 工作流程编译进 LLM 权重:以两位数成本实现接近前沿的质量
人工智能
2026-05-22 v1 机器学习
摘要
Agent 编排框架数量众多,合计超过 29 万个 GitHub 星,涵盖 LangGraph、CrewAI、Google ADK、OpenAI Agents SDK、Semantic Kernel、Strands 和 LlamaIndex。所有框架都遵循相同的模式:在 LLM 之上构建外部编排器,每一步注入指令并进行路由决策。最近的研究表明,这种架构在程序化任务中主要通过在 frontier 模型系统提示中提供程序即可占据主导地位 [Dennis 等,2026a],但代价是消耗上下文窗口、每个对话都需要 frontier 模型,以及将专有程序暴露给第三方提供商。将程序编译进小型微调模型的权重中——创建次表层智能体——应能解决所有问题,先前工作(SimpleTOD、FireAct、SynTOD、WorkflowLLM、Agent Lumos)已证明该技术可行。然而,开发者的采用仍然偏好编排。我们识别了三个被认为的障碍,并分别在旅行预订(14 个节点)、Zoom 支持(14 个节点,产品特定知识)和保险理赔(55 个节点,6 个决策枢纽)中进行实证测试。
引用
@article{arxiv.2605.22502,
title = {Compiling Agentic Workflows into LLM Weights: Near-Frontier Quality at Two Orders of Magnitude Less Cost},
author = {Simon Dennis and Rivaan Patil and Kevin Shabahang and Hao Guo},
journal= {arXiv preprint arXiv:2605.22502},
year = {2026}
}
备注
19 pages