SemantiCache:基于语义分块和聚类合并的高效 KV 缓存压缩
计算与语言
2026-03-17 v1
摘要
现有的 KV 缓存压缩方法通常针对离散标记或非语义块进行操作,但这些方法常导致语义碎片化, linguistically 有义单元被破坏,造成信息不可逆损失和性能下降。为此,本文引入 SemantiCache,一种保持语义完整性的压缩框架,通过将压缩过程与语言的语义层次性相吻合来实现。具体而言,本文首先通过分隔符将缓存划分为语义连贯的块,这些分隔符是自然的语义边界。在每个块内部,我们引入一种计算效率高的贪心基于种子的聚类(GSC)算法,将标记分组为语义聚类。这些聚类进一步被合并为语义核心,通过比例注意力机制重新平衡被合并标记的注意力贡献。广泛的实验表明,SemantiCache 在多样化的基准和模型上,使解码阶段推理速度提升最高可达 2.61 倍,显著降低内存占用,同时保持与原始模型相当的性能。
引用
@article{arxiv.2603.14303,
title = {SemantiCache: Efficient KV Cache Compression via Semantic Chunking and Clustered Merging},
author = {Shunlong Wu and Hai Lin and Shaoshen Chen and Tingwei Lu and Yongqin Zeng and Shaoxiong Zhan and Hai-Tao Zheng and Hong-Gee Kim},
journal= {arXiv preprint arXiv:2603.14303},
year = {2026}
}