张量缓存:基于驱逐条件的Transformer关联记忆
机器学习
2026-05-25 v1 人工智能
摘要
自回归Transformer的KV缓存随上下文长度线性增长;滑动窗口缓存虽能限制内存,但完全丢弃被驱逐的token,导致窗口外部的相关证据无法被访问。我们提出\emph{张量缓存}(Tensor Cache),一种两级缓存结构,将滑动窗口softmax注意力作为一级缓存(L1),将固定大小的外积快速权重记忆作为二级缓存(L2),由从窗口中被驱逐的KV对填充。最近的token保持精确的局部注意力;被驱逐的KV对被压缩为每层矩阵 ,通过单次矩阵乘法被后续查询读取,利用线性注意力恒等式 。我们引入一个学习标量门来融合L1和L2的输出,并对每个头的衰减率和写入速率参数进行端到端训练。外积记忆和读取恒等式是众所周知的;我们的贡献在于将其作为仅由滑动窗口驱逐所填充的L2缓存,以及指出常见的分块均值训练技巧 隐式引入了每块 个不必要的跨token外积,并通过等价于在float32误差范围内的逐token写入的并行加权求和扫描来弥合这一差距。在系统规模化、受控关联记忆、长上下文语言建模和记忆容量诊断等方面,张量缓存在有界状态基线的内存-质量前沿上实现了提升。
引用
@article{arxiv.2605.22884,
title = {Tensor Cache: Eviction-conditioned Associative Memory for Transformers},
author = {Kabir Swain and Sijie Han and Daniel Karl I. Weidele and Mauro Martino and Antonio Torralba},
journal= {arXiv preprint arXiv:2605.22884},
year = {2026}
}