利用提示编排加速语言模型工作流
计算与语言
2025-12-30 v1
摘要
大型语言模型越来越多地部署于多智能体工作流中。我们引入了 Prompt Choreography,这是一个通过维护动态全局 KV 缓存来高效执行 LLM 工作流的框架。每次 LLM 调用都可以关注先前编码消息的任意重排序子集。该框架支持并行调用。尽管缓存消息的编码有时会得出与在新上下文中重新编码这些消息不同的结果,但我们在多种设定下表明,对 LLM 进行微调以使其与缓存协同工作,可以帮助其模拟原始结果。Prompt Choreography 显著降低了每条消息的延迟(首字延迟快 2.0--6.2 倍),并在一些由冗余计算主导的工作流中实现了显著的端到端加速(超过 2.2 倍)。
引用
@article{arxiv.2512.23049,
title = {Accelerating Language Model Workflows with Prompt Choreography},
author = {TJ Bai and Jason Eisner},
journal= {arXiv preprint arXiv:2512.23049},
year = {2025}
}
备注
to appear in TACL (final preprint of 2025-10-12); 10 pages + appendices