中文

MiniKV:通过2位分层判别KV缓存推动LLM推理极限

计算与语言 2025-06-10 v3 机器学习

摘要

如何在实际中高效服务LLM已成为极具挑战性,因为其禁用在推理中的内存和计算要求。在本研究中,我们研究了优化KV缓存,因为其内存占用在LLM推理中尤其在处理长上下文任务时构成关键瓶颈。为应对这一挑战,我们引入了MiniKV,这是一种KV缓存优化方法,同时在保持长上下文任务准确性的同时显著减少KV缓存大小,方法是采用一种新颖的2位分层判别KV缓存。更重要的是,我们开发了专门的CUDA内核,使MiniKV能够与FlashAttention兼容。在广泛的长上下文任务实验中,MiniKV有效实现了86%的KV缓存压缩比率,同时恢复了超过98.5%的准确性,超越了最先进的方法,同时实现了出色的测量系统性能提升。

关键词

引用

@article{arxiv.2411.18077,
  title  = {MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache},
  author = {Akshat Sharma and Hangliang Ding and Jianping Li and Neel Dani and Minjia Zhang},
  journal= {arXiv preprint arXiv:2411.18077},
  year   = {2025}
}