中文

Meta-Soft:基于可组合 Meta-Token 的上下文保持 KV Cache 压缩

人工智能 2026-05-26 v2

摘要

大型语言模型的 KV Cache 具有线性增长的时间复杂性,导致 LLM 在处理长上下文时面临内存爆炸和解码效率下降问题。当前的 KV Cache 淘汰已成为重要的研究方向,但基于固定 Soft Token(如 Judge Q)的方法依赖静态参数集作为查询来评估 KV 对的重要性,无法适应不同输入提示的动态需求,亦无法精确捕获复杂且变化的任务相关性。此外,被淘汰的 KV 对被永久丢弃,导致信息不可逆损失和上下文中断。为此,我们提出了 Meta-Soft,一种基于探针驱动的上下文集成动态压缩框架。具体而言,我们构建一个包含可学习正交基矩阵 L\mathcal{L} 的 meta 库,并使用带 Gumbel-Softmax 的选择器网络产生可微稀疏组合权重,从而动态合成输入提示特征中最有针对性的 kk 个 Soft Token。我们将这些 Soft Token 添加到输入序列末端以探针获取关键信息。我们还引入了基于注意力流的集成机制,将被删除标记的语义信息重新分配到保留的标记中,从而有效保持被丢弃的上下文信息。实验表明,我们的方法在多个数据集上优于现有的领先淘汰方法,为 KV Cache 压缩提供了一种新解决方案。

关键词

引用

@article{arxiv.2605.22337,
  title  = {Meta-Soft: Leveraging Composable Meta-Tokens for Context-Preserving KV Cache Compression},
  author = {Wei Luo and Yi Huang and Songchen Ma and Huanyu Qu and Jiang Cai and Mingkun Xu},
  journal= {arXiv preprint arXiv:2605.22337},
  year   = {2026}
}

备注

9 pages, 2 figures