情境、推理与层次:在对抗性POMDP中复合LLM代理设计的成本-性能研究
人工智能
2026-05-18 v1 计算与语言
机器学习
多智能体系统
系统与控制
系统与控制
摘要
在对抗性、部分可观测序列环境中部署复合LLM代理需要导航多个设计维度:(1) 代理看到什么,(2) 它如何推理,以及 (3) 任务如何在组件之间分解。然而,实践者缺乏关于哪些设计选择提高性能而不仅仅增加推理成本的指导。我们在CybORG CAGE-2中进行受控研究,这是一个建模为部分可观测马尔可夫决策过程 (POMDP) 的网络防御环境。奖励为非正数,因此所有配置都以失败缓解模式运行。我们的评估涵盖五个模型家族、六个模型和十二个配置 (4,475 集 episodes),并进行 token 级别成本计量。我们变更情境表示 (原始观察 vs. 确定性状态跟踪层带压缩历史),推理 (自问答、自批判和自改进工具,带可选链律思考提示),以及层次分解 (单体ReAct vs. 分配给专门子代理)。我们发现:(1) 程序化状态抽象是每个 token 消耗中获得最大收益的 (RPTS),在原始观察之上将平均回报提高最高可达76%。(2) 在层次结构中分发推理工具会导致性能下降,相对于仅有层次结构而言,最坏情况可达3.4 更差的平均回报,同时使用1.8-2.7更多的 token。我们将这种破坏性模式称为推理级联。(3) 在没有推理的情况下进行层次分解可为大多数模型实现最佳绝对性能,情境工程通常比推理更具成本效益。这些发现建议一种设计原则用于结构化对抗性POMDP:在更深入的代理推理之前,投资于程序化基础设施和干净的任务分解,而这些策略在组合时可能产生干扰。
引用
@article{arxiv.2605.16205,
title = {Context, Reasoning, and Hierarchy: A Cost-Performance Study of Compound LLM Agent Design in an Adversarial POMDP},
author = {Igor Bogdanov and Chung-Horng Lung and Thomas Kunz and Jie Gao and Adrian Taylor and Marzia Zaman},
journal= {arXiv preprint arXiv:2605.16205},
year = {2026}
}