中文

自适应软滚动 KV 冻结与熵引导恢复:高效 LLM 推理的子线性内存增长

机器学习 2025-12-15 v1 人工智能 计算与语言

摘要

我们提出了自适应软滚动 KV 冻结与熵引导恢复(ASR-KF-EGR),一个用于高效大语言模型生成的训练无关推理时框架。我们的方法引入了一种可逆的软冻结机制,在滑动注意力窗口内暂时暂停低重要性 token 的键值(KV)更新。与永久丢弃上下文的驱逐方法不同,ASR-KF-EGR 将所有 token 保留在 GPU 外部存储中并按需恢复。我们通过子线性冻结调度扩展了该框架,其中冻结持续时间随重复低重要性检测呈子线性增长,防止过度压缩。在 LLaMA-3 8B 上的初步实验表明,在保持生成质量并通过 haystack 中找针检索测试的同时,活跃 KV 缓存大小减少了 55-67%。该方法架构无关,无需微调,为长上下文 LLM 的内存受限部署提供了实用解决方案。

关键词

引用

@article{arxiv.2512.11221,
  title  = {Adaptive Soft Rolling KV Freeze with Entropy-Guided Recovery: Sublinear Memory Growth for Efficient LLM Inference},
  author = {Adilet Metinov and Gulida M. Kudakeeva and Bolotbek uulu Nursultan and Gulnara D. Kabaeva},
  journal= {arXiv preprint arXiv:2512.11221},
  year   = {2025}
}

备注

6 pages, 3 tables , 1 figure