中文

LLMCache:用于加速Transformer推理中复用的逐层缓存策略

计算与语言 2026-03-03 v1 人工智能

摘要

基于Transformer的语言模型在广泛的任务中取得了显著性能,但其高推理延迟对实时和大规模部署构成了重大挑战。虽然现有的缓存机制(如token级键值缓存)在自回归解码中提供了加速,但它们在范围和适用性上有限。在此,我们提出了LLMCache,一种新颖的逐层缓存框架,通过基于输入序列语义相似性复用中间激活来加速Transformer推理。与先前工作不同,LLMCache是模型无关的,适用于编码器和解码器架构,并支持在任意Transformer层进行缓存。我们引入了一种轻量级指纹机制来匹配语义相似的输入,并提出了自适应逐出策略来管理缓存陈旧性。在BERT和GPT-2上针对SQuAD、WikiText-103和OpenBookQA的实验显示推理时间最多加速3.1倍,准确率下降小于0.5%。我们的结果表明LLMCache是优化Transformer推理在真实世界应用中的实用且通用的解决方案。

关键词

引用

@article{arxiv.2512.16843,
  title  = {LLMCache: Layer-Wise Caching Strategies for Accelerated Reuse in Transformer Inference},
  author = {Harsh Vardhan Bansal},
  journal= {arXiv preprint arXiv:2512.16843},
  year   = {2026}
}

备注

Accepted and presented at 13th IEEE International Conference on Intelligent Systems and Embedded Design (ISED-2025)