大语言模型推理系统综述
数据库
2025-06-30 v1
摘要
过去几年来,针对大语言模型(LLM)推理系统的专门化研究涌现,包括vLLM、SGLang、Mooncake和DeepFlow等,伴随着如ChatGPT等服务的快速LLM采用。推动这些系统设计努力的是LLM请求处理的独特自回归特性,激发了在高吞吐量和高频率工作负载下实现高性能的同时保持高推理质量的新技术。虽然许多这些技术在文献中讨论,但它们尚未在完整推理系统的框架下进行分析,也未对这些系统本身进行分析和比较。本综述回顾了这些技术,从请求处理的算子和算法开始,随后转向模型优化和执行技术,包括内核设计、批处理和调度,最终涉及内存管理技术,包括分页内存、驱逐和卸载技术、量化以及缓存持久化。通过这些讨论,我们表明这些技术本质上依赖于负载预测、适应机制和成本降低,以克服自回归生成带来的挑战,实现系统目标。我们随后讨论了如何将这些技术组合形成单副本和多副本推理系统,包括提供更灵活资源分配的解耦式推理系统,以及可部署在共享硬件基础设施上的无服务器系统。我们以讨论剩余挑战结束。
引用
@article{arxiv.2506.21901,
title = {A Survey of LLM Inference Systems},
author = {James Pan and Guoliang Li},
journal= {arXiv preprint arXiv:2506.21901},
year = {2025}
}
备注
25 pages