中文

BanaServe:用于平衡 LLM 离散化服务的统一 KV 缓存与动态模块迁移

分布式、并行与集群计算 2026-03-11 v1

摘要

大语言模型(LLM)正在 AI 基础设施中不断部署,推动了对高吞吐量和高效资源利用的需求。分离的 LLM 服务将提示预填充与自回归解码分离,已成为一种前景十足的架构,通过隔离它们的异构计算和内存需求来实现。然而,当前分离的系统面临三个关键局限:(i) 静态资源分配无法适应高度动态的工作负载,导致资源过度配置浪费或不足配置违反服务水平目标(SLO);(ii) 预填充和解码阶段之间固有的负载不平衡,预填充受计算限制,解码受内存限制,导致一个层级在一个环节下资源利用不足,而另一个环节成为瓶颈;(iii) 前缀缓存感知的路由导致负载分布不均,由于高缓存命中率的预填充节点吸引了不成比例的请求数,进一步恶化了平衡和效率。为解决这些问题,我们提出了 BanaServe——一个动态编排框架,通过持续在预填充和解码实例之间重新分配计算和内存资源,消除由缓存引起的热点。BanaServe 引入了层级权重迁移、注意力级键值缓存(KV Cache)迁移以及全局 KV Cache Store 共享与层级重叠传输,使我们能够以最小的延迟开销实现粗粒度(层级)和细粒度(注意力级)负载重新分配。这些机制使路由器能够进行纯粹基于负载的调度,无需受缓存放置的约束。相较于 vLLM,BanaServe 在吞吐量上实现 1.2 倍至 3.9 倍提升,总处理时间降低 3.9% 至 78.4%;在 DistServe 上,吞吐量提升 1.1 倍至 2.8 倍,延迟降低 1.4% 至 70.1%。

关键词

引用

@article{arxiv.2510.13223,
  title  = {BanaServe: Unified KV Cache and Dynamic Module Migration for Balancing Disaggregated LLM Serving in AI Infrastructure},
  author = {Yiyuan He and Minxian Xu and Jingfeng Wu and Jianmin Hu and Chong Ma and Min Shen and Le Chen and Chengzhong Xu and Lin Qu and Kejiang Ye},
  journal= {arXiv preprint arXiv:2510.13223},
  year   = {2026}
}

备注

23 pages