并非所有标记都值得缓存:面向LLM前缀缓存的语义感知驱动逐出策略
机器学习
2026-05-20 v1 分布式、并行与集群计算
摘要
前缀缓存是大型语言模型(LLM)服务中的关键优化,通过在共享提示前缀的请求之间复用注意力Key-Value(KV)状态来减少昂贵的预填计算。然而,其效益严重依赖于逐出策略,因为GPU内存有限,现有策略如LRU大致统一地对待已缓存的块。这种观点忽略了LLM提示的一个基本属性:并非所有标记都同等值得缓存。我们表明,提示中不同类型的标记(包括系统提示、用户查询、工具输出、模型响应和链式思考推理)在重复使用率上存在最高达756倍的差异,但目前没有任何逐出策略利用这一信号。本文提出SAECache(语义感知前缀缓存逐出),通过三个创新措施弥补这一差距:(1)多队列架构将KV块路由到具有特定任务的队列,采用量身定制的优先级指标,既捕捉多轮请求中的会话复用,又捕捉模板化单轮请求中的结构复用;(2)语义感知标记加权机制通过逐出反馈在线学习不同标记类型的复用价值;(3)完全自适应的在线学习方案用于所有参数更新,包括对数正态时间参数、位置衰减幂、队列权重和元参数,这消除了手动调参的需求,使系统能够自动适应部署特定的工作负载特征。在广泛的异构工作负载上进行的大规模评估表明,SAECache相对于生产级基线实现1.4倍至2.7倍的TTFT改进,而固定参数的替代方案在工作负载不匹配时可能恶化最高达2.7倍——这种不匹配的失败模式是我们自适应方法完全避免的。
引用
@article{arxiv.2605.18825,
title = {Not All Tokens Are Worth Caching: Learning Semantic-Aware Eviction for LLM Prefix Caches},
author = {Shaoke Fang and Ziang Li and Wenfei Wu and Jiatong Ji and Qingsong Liu and Ruizhi Pu},
journal= {arXiv preprint arXiv:2605.18825},
year = {2026}
}