中文

Marconi:面向混合 LLM 的前缀缓存

分布式、并行与集群计算 2025-04-11 v3 人工智能 机器学习

摘要

将注意力层的语言建模能力与循环层(如状态空间模型)的效率相结合的混合模型在实际支持大型语言模型服务的长上下文方面日益受到关注。然而,这些模型的独特特性使其难以使用诸如前缀缓存之类的补充效率优化(如跳过跨请求的冗余计算)。最显著的是,它们对循环层的原位状态更新使得无法对部分序列重叠回滚缓存条目,只能实现精确匹配的缓存命中;结果是每个序列都会产生大量(大型)缓存条目,其中大多数命中几乎没有重用的机会。我们提出 Marconi,第一个支持混合 LLM 高效前缀缓存的系统。Marconi 的关键在于其新颖的准入和逐出策略,更仔细地评估潜在缓存条目,不仅基于时间新鲜度,还基于(1)跨不同命中情景类型的复用概率预测,以及(2)相对于内存占用的计算节省。 在多样化的工作负载和混合模型上,Marconi 实现了最先进前缀缓存系统的最高可达 34.4 倍的 token 命中率(相当于 71.1% 或 617 毫秒更低的 TTFT)。

关键词

引用

@article{arxiv.2411.19379,
  title  = {Marconi: Prefix Caching for the Era of Hybrid LLMs},
  author = {Rui Pan and Zhuang Wang and Zhen Jia and Can Karakus and Luca Zancato and Tri Dao and Yida Wang and Ravi Netravali},
  journal= {arXiv preprint arXiv:2411.19379},
  year   = {2025}
}

备注

MLSys 2025 camera-ready version