LLM 缓存赤字重访:面向成本有效 LLM 推理的查询异构性问题
计算与语言
2025-09-22 v1
摘要
本文重访 LLM 缓存赤字问题,特别关注针对查询异构性实现成本有效的 LLM 推理。以往研究常假设查询大小均匀,异构的查询大小为缓存选择引入组合结构,使缓存替换过程在计算和统计上都更具挑战性。我们将最优缓存选择视为背包问题,采用累积策略有效平衡计算开销与缓存更新。在理论分析中,我们证明该算法的谢失值达到 上界,相较于 Berkeley 中的 结果改进了 的系数,其中 为查询总数, 为缓存大小。此外,我们还提供问题相关的上界,此特征在以往研究中并不存在。实验依赖真实数据表明,该算法将总体成本降低约 12%。
引用
@article{arxiv.2509.15515,
title = {LLM Cache Bandit Revisited: Addressing Query Heterogeneity for Cost-Effective LLM Inference},
author = {Hantao Yang and Hong Xie and Defu Lian and Enhong Chen},
journal= {arXiv preprint arXiv:2509.15515},
year = {2025}
}