中文

RAP:基于 RoPE 对齐剪枝的 KV-Cache 压缩

机器学习 2026-02-11 v3 人工智能

摘要

大型语言模型的长上下文推理正受到 KV-Cache 内存和计算成本的瓶颈。低秩分解通过写入 WABW \approx A * B 压缩 KV 投影,其中 A 生成潜在 KV 状态,B 可吸收到下游权重中。在现代基于 RoPE 的 LLM 中,这种吸收失败:RoPE 强制潜在 KV 状态重建为全维,重新引入显著的内存和计算开销。我们提出 RoPE 对齐剪枝(RAP),通过剪枝整个 RoPE 对齐列对来保留 RoPE 的 2x2 旋转结构,恢复 B 的吸收,并消除重建。我们在 LLaMA-3-8B 和 Mistral-7B 上的评估表明,RAP 实现了 KV-Cache、注意力参数和 FLOPs 的 20-30% 联合压缩,同时保持强大的准确率。值得注意的是,RAP 将注意力延迟降低至基准的 83%(预填充)和 77%(解码)。

关键词

引用

@article{arxiv.2602.02599,
  title  = {RAP: KV-Cache Compression via RoPE-Aligned Pruning},
  author = {Jihao Xin and Tian Lyu and David Keyes and Hatem Ltaief and Marco Canini},
  journal= {arXiv preprint arXiv:2602.02599},
  year   = {2026}
}