FAEDKV:用于无偏KV缓存压缩的无限窗口傅里叶变换
计算与语言
2025-07-29 v1
摘要
大型语言模型(LLM)在长上下文任务中的效能常受到Key-Value(KV)缓存巨大的内存占用和计算需求的制约。当前的压缩策略,包括token驱逐和学习投影,常常导致偏置性表示——要么过度强调最近/高注意力token,要么反复降低早期上下文信息,且可能需要高昂的模型重新训练成本。我们提出FAEDKV(Frequency-Adaptive Infinite-Window for KV cache),一种新型、无需训练的KV缓存压缩框架,确保无偏信息保留。FAEDKV通过采用提出的无限窗口傅里叶变换(IWDFT)将KV缓存转换为频域,从而实现所有token对压缩表示的均等贡献,有效保留早期和最近的上下文信息。初步的频率消除研究确定了针对层级的关键谱分量进行针对性压缩。LongBench基准上的实验表明,FAEDKV在现有方法上实现最高22%的优势。此外,我们的方法在针对性检索准确性方面优于基于压缩的方法,尤其是在针对 Needle-In-A-Haystack 任务。
引用
@article{arxiv.2507.20030,
title = {FAEDKV: Infinite-Window Fourier Transform for Unbiased KV Cache Compression},
author = {Runchao Li and Yao Fu and Mu Sheng and Xianxuan Long and Haotian Yu and Pan Li},
journal= {arXiv preprint arXiv:2507.20030},
year = {2025}
}