别破坏缓存:面向长时程智能体任务的提示缓存评估
计算与语言
2026-02-03 v2
摘要
近期大型语言模型(LLM)智能体的进展使复杂的多轮智能体任务成为可能,这类任务需要大量工具调用,话语可跨数十次API调用,上下文窗口逐渐增大。然而,尽管主要LLM提供商提供提示缓存以降低成本和延迟,但其对智能体工作负载的益处在研究文献中仍未得到充分探索。据我们了解,目前尚无工作对这些成本节省进行量化,或比较不同缓存策略在多轮智能体任务中的效果。我们对OpenAI、Anthropic和Google三个主要LLM提供商的提示缓存进行了全面评估,并比较了三种缓存策略:完整上下文缓存、仅系统提示缓存、以及排除动态工具结果的缓存。我们在DeepResearch基准上进行评估,该基准中智能体自主执行真实世界的Web搜索工具调用以回答复杂研究问题,测量超过500次智能体会话(系统提示约10,000 token)的API成本和首字延迟(TTFT)。我们的结果表明,提示缓存可在各提供商处将API成本降低41%-80%,将首字延迟提高13%-31%。我们发现,战略性的提示缓存块控制(例如将动态内容置于系统提示末尾、避免动态传统函数调用、排除动态工具结果)比单纯的完整上下文缓存能提供更一致的益处;而完整上下文缓存则可能产生相反的延迟增加。跨提示大小(500-50,000 token)和工具调用次数(3-50)的消融研究表明,在满足提供商缓存token最低要求后,成本和TTFT均呈线性增长,且揭示了各提供商在不同变体下的策略差异。我们提供细致的讨论和实施建议,以指导在生产环境智能体系统中实现提示缓存。
引用
@article{arxiv.2601.06007,
title = {Don't Break the Cache: An Evaluation of Prompt Caching for Long-Horizon Agentic Tasks},
author = {Elias Lumer and Faheem Nizar and Akshaya Jangiti and Kevin Frank and Anmol Gulati and Mandar Phadate and Vamse Kumar Subbiah},
journal= {arXiv preprint arXiv:2601.06007},
year = {2026}
}
备注
16 pages, 9 figures