中文

LLM 缓存赤字重访:面向成本有效 LLM 推理的查询异构性问题

计算与语言 2025-09-22 v1

摘要

本文重访 LLM 缓存赤字问题,特别关注针对查询异构性实现成本有效的 LLM 推理。以往研究常假设查询大小均匀,异构的查询大小为缓存选择引入组合结构,使缓存替换过程在计算和统计上都更具挑战性。我们将最优缓存选择视为背包问题,采用累积策略有效平衡计算开销与缓存更新。在理论分析中,我们证明该算法的谢失值达到 O(MNT)O(\sqrt{MNT}) 上界,相较于 Berkeley 中的 O(MNT)O(MN\sqrt{T}) 结果改进了 MN\sqrt{MN} 的系数,其中 NN 为查询总数,MM 为缓存大小。此外,我们还提供问题相关的上界,此特征在以往研究中并不存在。实验依赖真实数据表明,该算法将总体成本降低约 12%。

关键词

引用

@article{arxiv.2509.15515,
  title  = {LLM Cache Bandit Revisited: Addressing Query Heterogeneity for Cost-Effective LLM Inference},
  author = {Hantao Yang and Hong Xie and Defu Lian and Enhong Chen},
  journal= {arXiv preprint arXiv:2509.15515},
  year   = {2025}
}