KQ-SVD:在注意力保真性方面压缩 KV 缓存
机器学习
2025-12-08 v1
摘要
Key-Value (KV) 缓存是基于转换器的大型语言模型 (LLM) 效率的核心,存储先前计算的向量以加速推理。然而,随着序列长度和批量大小的增长,缓存成为主要的内存瓶颈。先前的压缩方法通常仅对键应用低秩分解,或尝试联合嵌入查询和键,但两种方法都忽视了注意力本质上依赖于它们的内积。在本工作中,我们证明了此类策略对于近似注意力矩阵是次优的。我们引入 KQ-SVD,通过闭式解直接执行注意力矩阵的最优低秩分解。通过针对真正的冗余来源,KQ-SVD 在压缩下保持更高保真度的注意力输出。在 LLaMA 和 Mistral 模型上的大规模评估表明,我们的方法一致地提供了优越的投影质量。
引用
@article{arxiv.2512.05916,
title = {KQ-SVD: Compressing the KV Cache with Provable Guarantees on Attention Fidelity},
author = {Damien Lesens and Beheshteh T. Rakhshan and Guillaume Rabusseau},
journal= {arXiv preprint arXiv:2512.05916},
year = {2025}
}