EliteKV:基于RoPE频率选择与联合低秩投影的可扩展KV缓存压缩方案
机器学习
2025-03-04 v1 人工智能
计算与语言
摘要
旋转位置嵌入(RoPE)使每个注意力头能够沿序列维度捕获多频率信息,广泛应用于基础模型。然而,RoPE引入的非线性复杂化了对键状态(Key-Value, KV)缓存中键状态进行优化。现有的KV缓存压缩方法通常在旋转前存储键状态,并在解码时应用变换,引入额外的计算开销。本文提出EliteKV,一种支持可变KV缓存压缩比例的灵活RoPE模型修改框架。EliteKV首先利用RoPElite识别每个头的内在频率偏好,选择性地在注意力计算中恢复键的部分维度的线性性。基于此,进行键值联合低秩压缩,实现部分缓存共享。实验结果表明,仅需对原始训练数据的0.6%进行微调,RoPE-based模型在KV缓存大小上实现75%的压缩,同时保持性能在可接受范围内。此外,EliteKV在同一模型家族中不同规模的模型上均表现良好。
引用
@article{arxiv.2503.01586,
title = {EliteKV: Scalable KV Cache Compression via RoPE Frequency Selection and Joint Low-Rank Projection},
author = {Yuhao Zhou and Sirui Song and Boyang Liu and Zhiheng Xi and Senjie Jin and Xiaoran Fan and Zhihao Zhang and Wei Li and Xuanjing Huang},
journal= {arXiv preprint arXiv:2503.01586},
year = {2025}
}
备注
13 pages, 8 figures