中文

HashEvict:基于局部敏感哈希的预注意力KV缓存驱逐策略

计算机科学中的逻辑 2025-01-10 v2 机器人学

摘要

基于Transformer的大型语言模型(LLM)使用键值(KV)缓存显著加速推理,通过存储过去标记的键和值嵌入。然而,该缓存消耗大量 GPU 内存。在本工作中,我们引入 HashEvict,该算法使用局部敏感哈希(LSH)压缩 KV 缓存。HashEvict 快速定位与当前查询标记余弦不相似的缓存标记。这通过计算当前查询标记与缓存标记键的二进制高斯投影之间的汉明距离实现,投影长度为嵌入维度的更小值。我们在 GPU 内存中维护一个轻量级二进制结构来促进这些计算。与现有压缩策略不同,HashEvict 在注意力计算之前做出这些决定,从而降低计算成本。此外,HashEvict 是动态的——在每个解码步骤中,当前标记的键和值会替换预计产生最低注意力得分的标记的嵌入。我们展示了 HashEvict 可将 KV 缓存压缩 30%-70%,同时在推理、多选题、长上下文检索和摘要任务中保持高性能。

关键词

引用

@article{arxiv.2412.16186,
  title  = {Formal Modeling and Verification of Publisher-Subscriber Paradigm in ROS 2},
  author = {Jahid Chowdhury Choton and Lipsy Gupta and Pavithra Prabhakar},
  journal= {arXiv preprint arXiv:2412.16186},
  year   = {2025}
}

备注

The co-authors have asked to withdraw this paper, since it contains incomplete and incorrect informations