DynSplit-KV:用于高效长上下文LLM推理的动态语义分段KVCache压缩
机器学习
2026-02-04 v1 计算与语言
摘要
虽然键值(KV)缓存对大语言模型(LLM)的高效推理至关重要,但在长上下文场景中其日益增长的内存占用已成为重要瓶颈,使得KVCache压缩至关重要。当前压缩方法依赖刚性分段策略,如固定间隔或预定义分隔符。我们观察到,刚性分段因语义边界场景依赖性而在不同情境下出现显著精度衰减(范围从5.5%到55.1%),这凸显了需要动态语义分段以适配语义的必要性。为实现此目标,我们面临两个挑战:(1)错误的分隔符选择导致KVCache与语义错位,造成28.6%的精度损失;(2)分段后变量长度块引入超过73.1%的额外推理开销。为此,我们提出DynSplit-KV,一种动态识别分隔符进行分段的KVCache压缩方法。我们提出:(1)一种动态重要性感知分隔符选择策略,提升精度49.9%;(2)一种统一映射策略,将变量长度语义块转换为固定长度格式,推理开销降低4.9倍。实验表明,DynSplit-KV在精度上达到最高水平,相较于FlashAttention实现2.2倍加速,在峰值内存方面实现2.6倍降低,适用于长上下文场景。
引用
@article{arxiv.2602.03184,
title = {DynSplit-KV: Dynamic Semantic Splitting for KVCache Compression in Efficient Long-Context LLM Inference},
author = {Jiancai Ye and Jun Liu and Qingchen Li and Tianlang Zhao and Hanbin Zhang and Jiayi Pan and Ningyi Xu and Guohao Dai},
journal= {arXiv preprint arXiv:2602.03184},
year = {2026}
}