Valve:基于联合约束抢占延迟和速率的生产在线-离线推理混合部署
操作系统
2026-04-10 v1
摘要
LLM 推理正在为延迟关键的生产服务提供动力。推理流量的突发性导致过度配置,进而导致资源 underutilization。虽然在线-离线混合部署承诺利用闲置容量,但必须克服两个主要挑战:(i)由于慢或频繁的抢占导致的大规模在线干扰,(ii)为混合部署不同模型和支持抢占所需的大量框架和驱动修改。我们提出了 Valve,一种在线-离线混合部署系统,联合约束抢占延迟和抢占速率。具体而言,Valve 在每一次在线请求中最多进行一次亚毫秒级计算抢占,并对子层内存回收进行速率限制。通过结合受控通道计算隔离、无页面故障的内存回收和动态内存保留的 GPU 运行时,提供了这些保证。关键的是,Valve 易于部署,只需一行驱动修改和 20 行框架补丁。在生产部署了 8,054 个 GPU 后,Valve 将集群资源利用率提高了 34.6%,这相当于节省了 2,170 个 GPU。这种效率收益以最小的在线干扰实现,整个工作负载的 TTFT 增加不到 5%,TPOT 增加不到 2%。
引用
@article{arxiv.2604.07874,
title = {Valve: Production Online-Offline Inference Colocation with Jointly-Bounded Preemption Latency and Rate},
author = {Fangyue Liu and Hua Liu and Xinyuan Lyu and Shuo Ai and Hao Liang and Lingpeng Chen and Ziqian Hu and Chong Zha and Xin Jin and Hanmei Luo and Peng Chen},
journal= {arXiv preprint arXiv:2604.07874},
year = {2026}
}