中文

请求必须如鸟群般聚集:批次大小与前缀同质性在大语言模型推理中的权衡

机器学习 2026-05-08 v1

摘要

大型语言模型中的自回归标记生成因需"注意"所有先前标记的键值张量 (KV缓存) 而导致内存受限。既有工作旨在通过批处理多个请求来提高此解码过程的效率,并在GPU内存限制下最大化批次大小。我们的关键观察是,在前缀共享工作负载下,较小的前缀同质批次——即所有请求共享公共前缀的批次——可实现更高的解码吞吐量,因为在KV缓存访问中实现更好的空间和时间局部性。然而,前缀感知的调度器仅为减少KV缓存内存占用而最大化前缀重用,但不会在可能表现更好的较小同质批次上停止批次形成。进一步我们展示,现有调度器中的前缀检测依赖于 radix 树遍历,造成相当于GPU执行时间的大量CPU开销。本文提出Feather,一种基于强化学习 (RL) 的前缀感知调度器,用于学习批次大小与前缀同质性之间的最优权衡。我们还引入Chunked Hash Tree (CHT),一种轻量级数据结构,实现快速前缀检测和高效请求选择,避免昂贵的树遍历。我们将Feather集成到vLLM和SGLang中,评估显示Feather在现有调度器基础上实现2--10倍的端到端吞吐量提升,而在工作负载不具足够前缀共享时表现不逊于现状。Feather通过减少总体KV缓存访问次数,超越了具有相同目标的前缀感知注意力内核的性能。

关键词

引用

@article{arxiv.2605.06046,
  title  = {Requests of a Feather Must Flock Together: Batch Size vs. Prefix Homogeneity in LLM Inference},
  author = {Saksham Rathi and Preeti and Mythili Vutukuru},
  journal= {arXiv preprint arXiv:2605.06046},
  year   = {2026}
}

备注

22 pages, 36 figures