中文

FlexLLM:具有 SLO 保证的 LLM 推理与微调的 Token 级协同服务

分布式、并行与集群计算 2025-10-27 v3 计算与语言 机器学习

摘要

大语言模型(LLMs)的微调对于任务适配至关重要,然而当今的服务栈将推理和微调隔离在独立的 GPU 集群上,导致资源浪费和硬件利用率不足。我们推出了 FlexLLM,这是首个通过在 Token 级融合计算,在共享 GPU 上协同服务 LLM 推理和基于 PEFT 的微调的系统。FlexLLM 的静态编译优化——依赖并行化和图剪枝,显著减少了激活内存,从而实现了高达 80% 的端到端 GPU 内存节省。在运行时,一种新颖的 Token 级微调机制 paired with 混合 Token 调度器,在每个协同服务迭代中动态交错推理和训练 Token,在满足严格延迟 SLO 的同时最大化利用率。在 LLaMA-3.1-8B、Qwen-2.5-14B 和 Qwen-2.5-32B 上的端到端基准测试表明,FlexLLM 在高达 20 req/s 的负载下保持推理 SLO 合规性,并在重推理负载下将微调吞吐量提高 1.94.8×1.9-4.8\times,在轻负载下提高 2.56.8×2.5-6.8\times,即使在峰值需求下也能保留超过 76% 的峰值微调进度。FlexLLM 已在 https://flexllm.github.io 公开。

关键词

引用

@article{arxiv.2402.18789,
  title  = {FlexLLM: Token-Level Co-Serving of LLM Inference and Finetuning with SLO Guarantees},
  author = {Gabriele Oliaro and Xupeng Miao and Xinhao Cheng and Vineeth Kada and Mengdi Wu and Ruohan Gao and Yingyi Huang and Remi Delacourt and April Yang and Yingcheng Wang and Colin Unger and Zhihao Jia},
  journal= {arXiv preprint arXiv:2402.18789},
  year   = {2025}
}

备注

NSDI 2026