上下文提示使程序性任务的智能体编排过时
人工智能
2026-05-07 v2 机器学习
摘要
智能体编排框架——LangGraph、CrewAI、Google ADK、OpenAI Agents SDK 等——将外部编排器置于大语言模型(LLM)之上,在每一步跟踪状态并注入路由指令。我们展示了一项受控比较,结果表明对于程序性任务,这种架构被一种更简单的替代方案所超越:将整个程序放入系统提示中,让模型自我编排。在三个领域——旅行预订(14 个节点)、Zoom 技术支持(14 个节点)和保险索赔处理(55 个节点)——我们使用 LLM-as-judge 评分法,在五个质量标准上评估了每种条件下 200 次对话。上下文方法在 5 分制中得分为 4.53–5.00,而使用相同模型的 LangGraph 编排器得分为 4.17–4.84。编排系统在旅行、Zoom 和保险对话中的失败率分别为 24%、9% 和 17%,而上下文基线的失败率分别为 11.5%、0.5% 和 5%。虽然外部编排对于早期模型可能是必要的,但前沿模型能力的进步使其对于遵循既定程序的多轮对话已不再必要。
引用
@article{arxiv.2604.27891,
title = {In-Context Prompting Obsoletes Agent Orchestration for Procedural Tasks},
author = {Simon Dennis and Michael Diamond and Rivaan Patil and Kevin Shabahang and Hao Guo},
journal= {arXiv preprint arXiv:2604.27891},
year = {2026}
}
备注
20 pages