面向云端 LLM (大语言模型) 的高效无服务器推理服务
分布式、并行与集群计算
2024-11-26 v1 机器学习
摘要
本综述报告讨论了无服务器推理中的冷启动延迟及现有解决方案。特别关注 ServerlessLLM 方法,这是一种旨在解决大语言模型无服务器推理冷启动问题的系统。传统无服务器方法因 LLM 检查点大小及初始化 GPU 资源开销而导致高延迟。ServerlessLLM 引入多层次检查点加载系统,利用闲置 GPU 内存和存储,将启动时间较现有方法缩短 6--8 倍。它还提出了动态推理迁移和针对启动时间优化的模型调度器,确保高效资源分配并最小化延迟。该系统在 LLM 工作负载下显著提升了性能和可扩展性。除 ServerlessLLM 本人外,本文还综述了包括 Rainbowcake 在内的近期研究文献中其他方法。进一步讨论了 FaaS 提供商如何应对冷启动问题以及可能的未来方向。
引用
@article{arxiv.2411.15664,
title = {Enabling Efficient Serverless Inference Serving for LLM (Large Language Model) in the Cloud},
author = {Himel Ghosh},
journal= {arXiv preprint arXiv:2411.15664},
year = {2024}
}
备注
12 pages, 7 figures, TUM Cloud Computing Seminar