LLMCache:用于加速Transformer推理中复用的逐层缓存策略
计算与语言
2026-03-03 v1 人工智能
摘要
基于Transformer的语言模型在广泛的任务中取得了显著性能,但其高推理延迟对实时和大规模部署构成了重大挑战。虽然现有的缓存机制(如token级键值缓存)在自回归解码中提供了加速,但它们在范围和适用性上有限。在此,我们提出了LLMCache,一种新颖的逐层缓存框架,通过基于输入序列语义相似性复用中间激活来加速Transformer推理。与先前工作不同,LLMCache是模型无关的,适用于编码器和解码器架构,并支持在任意Transformer层进行缓存。我们引入了一种轻量级指纹机制来匹配语义相似的输入,并提出了自适应逐出策略来管理缓存陈旧性。在BERT和GPT-2上针对SQuAD、WikiText-103和OpenBookQA的实验显示推理时间最多加速3.1倍,准确率下降小于0.5%。我们的结果表明LLMCache是优化Transformer推理在真实世界应用中的实用且通用的解决方案。
引用
@article{arxiv.2512.16843,
title = {LLMCache: Layer-Wise Caching Strategies for Accelerated Reuse in Transformer Inference},
author = {Harsh Vardhan Bansal},
journal= {arXiv preprint arXiv:2512.16843},
year = {2026}
}
备注
Accepted and presented at 13th IEEE International Conference on Intelligent Systems and Embedded Design (ISED-2025)