中文

当智能体沉默时:LLM文档合成的输出生成容量与格式-成本分离

人工智能 2026-04-21 v1

摘要

基于LLM的编码智能体遭受一种我们称之为输出停滞的、理解不足的失败模式:智能体在尝试生成大型、格式密集的文档时静默地产生空响应。我们提出了一个理论框架,通过三个贡献来解释和防止这种失败。(1) 我们引入了输出生成容量(OGC),一种对智能体在其当前上下文状态下有效产生输出能力的正式度量——它不同于原始上下文窗口,且经验上更小。(2) 我们证明了一个格式-成本分离定理,表明对于任何开销乘数μf>1\mu_f > 1的格式,延迟模板渲染在令牌效率上始终至少与直接生成相当,并推导出节省的紧界。(3) 我们形式化了自适应策略选择,一个决策框架,将估计的输出成本与可用OGC的比率映射到最优生成策略(直接、分块或延迟)。我们通过跨三个模型(Claude 3.5 Sonnet、GPT-4o、Llama 3.1 70B)、四种文档类型以及一个隔离每个组件贡献的消融研究的受控实验来验证该理论。延迟渲染在所有条件下将LLM生成令牌减少了48-72%,并完全消除了输出停滞。我们将该框架实例化为GEN-PILOT,一个开源的MCP服务器,证明该理论直接转化为实用工具。

关键词

引用

@article{arxiv.2604.16736,
  title  = {When Agents Go Quiet: Output Generation Capacity and Format-Cost Separation for LLM Document Synthesis},
  author = {Justice Owusu Agyemang and Michael Agyare and Miriam Kobbinah and Nathaniel Agbugblah and Prosper Addo},
  journal= {arXiv preprint arXiv:2604.16736},
  year   = {2026}
}