中文

HAMburger:通过 Token 粉碎加速 LLM 推理

计算与语言 2025-05-28 v1

摘要

对高效大型语言模型(LLM)推理日益增长的需求要求在算法、系统和硬件上进行整体优化。然而,很少有工作从根本上改变生成模式:每个 token 需要一次前向传播和一个 KV cache。这可能是次优的,因为我们发现 LLM 极其擅长自我识别单个 KV cache 可以存储的确切信息量,并且许多 token 可以在没有全局上下文的情况下自信地生成。基于这一洞察,我们引入了 HAMburger,一种分层自回归模型,它通过在推理期间超越每个 token 的统一计算和存储来重新定义 LLM 中的资源分配。在基础 LLM 之间堆叠一个组合嵌入器和一个微步解码器,HAMburger 将多个 token 粉碎成单个 KV,并每步生成多个 token。此外,HAMburger 充当推测解码框架,在其中它可以盲目信任自起草的 token。因此,HAMburger 将 KV cache 和前向 FLOPs 的增长相对于输出长度从线性转变为次线性,并根据查询困惑度和输出结构调整其推理速度。广泛的评估表明,HAMburger 将 KV cache 计算减少高达 2×\times,并实现高达 2×\times 的 TPS,同时在短上下文和长上下文任务中保持质量。我们的方法探索了一个极具挑战性的推理机制,该机制在硬件无关的设计下同时要求计算和内存的高效性。

关键词

引用

@article{arxiv.2505.20438,
  title  = {HAMburger: Accelerating LLM Inference via Token Smashing},
  author = {Jingyu Liu and Ce Zhang},
  journal= {arXiv preprint arXiv:2505.20438},
  year   = {2025}
}