中文

RAC:面向大型语言模型的关系感知缓存替换策略

机器学习 2026-02-26 v1

摘要

大型语言模型(LLM)服务的规模化面临着显著的成本和延迟挑战,使得在紧张容量下实现有效缓存至关重要。现有的缓存替换策略,从基于规则到基于学习的方法,主要依赖有限窗口的统计信号,如访问的新近性和频率。我们表明,这些信号对真实世界的 LLM 工作负载并不稳健,这些工作负载表现出长时间的重用距离和稀疏的局部重复。为了解决这些限制,我们提出了关系感知缓存(RAC),一种基于语义关系的在线驱逐策略,用于指导驱逐决策。RAC 合成了两种关系感知信号:(1)主题流行度(Topical Prevalence),它在主题级别聚合访问证据以捕捉长期范围的重用;(2)结构重要性(Structural Importance),它利用局部主题内部依赖结构来区分条目在未来重用的价值。广泛的评估表明,RAC 在 diverse 工作负载下保持高效,始终优于 SOTA 方法 20%--30% 的缓存命中率。

关键词

引用

@article{arxiv.2602.21546,
  title  = {Mamba Meets Scheduling: Learning to Solve Flexible Job Shop Scheduling with Efficient Sequence Modeling},
  author = {Zhi Cao and Cong Zhang and Yaoxin Wu and Yaqing Hou and Hongwei Ge},
  journal= {arXiv preprint arXiv:2602.21546},
  year   = {2026}
}