中文

你需要为本机位置无关缓存引入编码器

机器学习 2026-02-03 v1 人工智能

摘要

大型语言模型(LLM)的键值(KV)缓存是前缀式的,使得处理以任意顺序检索的上下文显得高度低效。位置无关缓存(PIC)已被提出以实现无位置约束的 KV 重用;然而,现有方法往往导致显著的准确度下降,限制了其实际采用。为此,我们提出通过重新引入编码器到主流仅解码器 LLM 中,并显式训练其支持 PIC 的本机方法。我们进一步开发了 COMB,一个与现有推理框架无缝集成的 PIC-aware 缓存系统。实验结果表明,COMB 将时间到首个标记(TTFT)降低 51%-94%,吞吐量提升约 3 倍,同时保持相当的准确度。此外,使用 DeepSeek-V2-Lite-Chat 的质量提升表明了 COMB 适用于其他类型的仅解码器 LLM 的可行性。我们的代码已公开于 https://github.com/shijuzhao/Comb。

关键词

引用

@article{arxiv.2602.01519,
  title  = {You Need an Encoder for Native Position-Independent Caching},
  author = {Shiju Zhao and Junhao Hu and Jiaqi Zheng and Guihai Chen},
  journal= {arXiv preprint arXiv:2602.01519},
  year   = {2026}
}

备注

12 pages, 10 figures. Welcome back, Encoder