FreqKV:面向上下文窗口扩展的频域键值压缩
计算与语言
2026-01-30 v3 人工智能
摘要
大型语言模型 (LLM) 现有的键值 (KV) 缓存压缩方法通常依赖于 token 驱逐,这在长预填充和解码场景中都有丢失关键局部信息的风险。当外推超出预训练上下文长度时,它们在长上下文基准上的性能急剧下降。受频域中上下文信息集中在低频分量的观察启发,我们提出了 FreqKV,一种无参数且与架构无关的方法。它在频域中迭代压缩不断增长的 KV 缓存,使模型能够高效处理冗长的上下文。通过在 8K 长度下进行最少的训练,FreqKV 将 LLaMA-2-7B 的上下文窗口扩展至 256K token,同时保持稳定的困惑度。在预填充和解码方面的广泛实验表明,FreqKV 能够实现稳健的上下文窗口扩展,并在 LLaMA-2 和 LLaMA-3 上始终优于现有的 KV 缓存压缩方法,突显了其在长上下文理解和生成方面的有效性。
引用
@article{arxiv.2505.00570,
title = {FreqKV: Key-Value Compression in Frequency Domain for Context Window Extension},
author = {Jushi Kai and Yixuan Wang and Boyi Zeng and Haoli Bai and Bo Jiang and Ziwei He and Zhouhan Lin},
journal= {arXiv preprint arXiv:2505.00570},
year = {2026}
}
备注
ICLR 2026