驯服巨型 AI:大语言模型高效推理服务综述
计算与语言
2025-04-29 v1 人工智能
分布式、并行与集群计算
机器学习
摘要
大规模语言模型(LLMs)在生成式 AI 中取得了显著进展,演变为广泛应用于各类领域和应用的高级且多功能工具。然而,由于其庞大的参数数量和注意力机制的高计算需求,所致的巨大内存开销以及高计算需求,构成了在实现低延迟和高吞吐量方面的重大挑战。近期涌现的突破性研究显著加速了该领域的进展。本文对这些方法进行全面综述,涵盖基本的实例级方法、深入的集群级策略、新兴的场景方向以及其他重要但非主流的领域。在实例层面,我们审阅了模型放置、请求调度、解码长度预测、存储管理以及解耦范式。在集群层面,我们探讨了GPU集群部署、多实例负载平衡以及云服务解决方案。对于新兴场景,我们围绕特定任务、模块和辅助方法进行组织讨论。为确保全面概览,我们还概述了几个尚属小众但至关重要的领域。最后,我们勾勒出进一步推动 LLM 推理服务领域的潜在研究方向。
引用
@article{arxiv.2504.19720,
title = {Taming the Titans: A Survey of Efficient LLM Inference Serving},
author = {Ranran Zhen and Juntao Li and Yixin Ji and Zhenlin Yang and Tong Liu and Qingrong Xia and Xinyu Duan and Zhefeng Wang and Baoxing Huai and Min Zhang},
journal= {arXiv preprint arXiv:2504.19720},
year = {2025}
}
备注
work in progress;11 pages of main paper with 7 main figures, overall 20 pages