RAP:基于 RoPE 对齐剪枝的 KV-Cache 压缩
机器学习
2026-02-11 v3 人工智能
摘要
大型语言模型的长上下文推理正受到 KV-Cache 内存和计算成本的瓶颈。低秩分解通过写入 压缩 KV 投影,其中 A 生成潜在 KV 状态,B 可吸收到下游权重中。在现代基于 RoPE 的 LLM 中,这种吸收失败:RoPE 强制潜在 KV 状态重建为全维,重新引入显著的内存和计算开销。我们提出 RoPE 对齐剪枝(RAP),通过剪枝整个 RoPE 对齐列对来保留 RoPE 的 2x2 旋转结构,恢复 B 的吸收,并消除重建。我们在 LLaMA-3-8B 和 Mistral-7B 上的评估表明,RAP 实现了 KV-Cache、注意力参数和 FLOPs 的 20-30% 联合压缩,同时保持强大的准确率。值得注意的是,RAP 将注意力延迟降低至基准的 83%(预填充)和 77%(解码)。
关键词
引用
@article{arxiv.2602.02599,
title = {RAP: KV-Cache Compression via RoPE-Aligned Pruning},
author = {Jihao Xin and Tian Lyu and David Keyes and Hatem Ltaief and Marco Canini},
journal= {arXiv preprint arXiv:2602.02599},
year = {2026}
}