从精确匹配到相似匹配: LLM 嵌入的语义缓存
计算与语言
2026-03-05 v1 人工智能
机器学习
摘要
大语言模型 (LLM) 的快速普及导致对更快响应和更低成本的需求。语义缓存通过复用语义相似的请求(基于其嵌入)来解决这一需求,但会破坏经典缓存假设,引发新挑战。本文探讨了语义缓存的离线策略,证明实现最优离线策略是 NP-hard 的,并提出了若干多项式时间的启发式方法。我们还提出了结合最近性、频率和局部性的在线语义感知缓存策略。在多样化数据集上的评估显示,尽管基于频率的策略是强大的基线,但我们新颖的变体在语义准确性方面取得了改进。我们的发现揭示了当前系统的有效策略,并为未来创新指出了巨大的潜在空间。所有代码均已开源。
引用
@article{arxiv.2603.03301,
title = {From Exact Hits to Close Enough: Semantic Caching for LLM Embeddings},
author = {Dvir David Biton and Roy Friedman},
journal= {arXiv preprint arXiv:2603.03301},
year = {2026}
}