Medha:针对 LLM 推理中的异构性问题的无请求不被抛弃方案
机器学习
2025-11-27 v5 分布式、并行与集群计算
摘要
部署百万级 token 的大语言模型(LLM)具有挑战性,因为生产工作负载高度异构,既混合短查询又混合长文档。这种异构性结合注意力的二次复杂度,导致严重的车队效应,其中长时间运行的请求阻塞短暂的交互式请求,降低系统响应性。我们提出了 Medha,一种消除此类车队效应的推理系统,通过引入细粒度、可抢占的调度来实现 LLM 推理。Medha 通过一组共设计的机制——包括自适应分块和流水线并行——克服了分块的感知效率和规模挑战。此外,我们提出了一种新的并行策略 KV 缓存并行,以减少解码延迟,使即使在非常长的上下文中也能实现交互式响应。这些机制由长度感知相对 slack(LARS)调度器协调,这是一种考虑到截止时间和异构性的调度策略,既防止车队效应,又防止更简单策略中常见的饥饿现象。在异构工作负载下,Medha 比基于最新非抢占系统的吞吐量提高 5.7 倍,同时将中位数和 99 百分位延迟分别降低 30 倍和 174 倍。
引用
@article{arxiv.2409.17264,
title = {No Request Left Behind: Tackling Heterogeneity in Long-Context LLM Inference with Medha},
author = {Amey Agrawal and Haoran Qiu and Junda Chen and Íñigo Goiri and Chaojie Zhang and Rayyan Shahid and Ramachandran Ramjee and Alexey Tumanov and Esha Choukse},
journal= {arXiv preprint arXiv:2409.17264},
year = {2025}
}