中文

ProxyKV: 面向高效长上下文LLM推理的跨模型代理剪枝

机器学习 2026-05-19 v1 人工智能

摘要

大型语言模型(LLM)中的高效长上下文推理受到键值(KV)缓存内存墙的严重制约,然而现有的剪枝方法迫使人们在低延迟启发式方法(牺牲精度)和高精度重建方法(带来高昂的预填充开销)之间做出选择。为了弥合这种评分成本与精度之间的差距,我们提出了ProxyKV,一种跨模型代理剪枝框架,它将重要性评分卸载给一个轻量级的族内小模型代理,该代理与大型模型目标异步执行。为了弥合异构模型之间的架构差距,我们设计了HybridAxialMapper,它将时间特征提取与跨头对齐解耦,并结合了多粒度混合损失,将学习目标从刚性回归转变为相对排序一致性。在涵盖7B到32B参数目标的Llama-3.1、Qwen-2.5和Qwen-3系列模型上,在LongBench、SCBench和RULER基准测试中,ProxyKV在总体上与KVZip相当(恢复了其平均精度的约98.7%),同时在Llama-3.1-8B上实现了高达3.21倍的预填充加速(双GPU;共享单GPU约1.5倍),并在Qwen-2.5-7B上于长达170k token的上下文中保持了加速效果。

关键词

引用

@article{arxiv.2605.16360,
  title  = {ProxyKV: Cross-Model Proxy Pruning for Efficient Long-Context LLM Inference},
  author = {Junjie Li and Jiong Lou and Jie Li},
  journal= {arXiv preprint arXiv:2605.16360},
  year   = {2026}
}