中文

面向云端 LLM (大语言模型) 的高效无服务器推理服务

分布式、并行与集群计算 2024-11-26 v1 机器学习

摘要

本综述报告讨论了无服务器推理中的冷启动延迟及现有解决方案。特别关注 ServerlessLLM 方法,这是一种旨在解决大语言模型无服务器推理冷启动问题的系统。传统无服务器方法因 LLM 检查点大小及初始化 GPU 资源开销而导致高延迟。ServerlessLLM 引入多层次检查点加载系统,利用闲置 GPU 内存和存储,将启动时间较现有方法缩短 6--8 倍。它还提出了动态推理迁移和针对启动时间优化的模型调度器,确保高效资源分配并最小化延迟。该系统在 LLM 工作负载下显著提升了性能和可扩展性。除 ServerlessLLM 本人外,本文还综述了包括 Rainbowcake 在内的近期研究文献中其他方法。进一步讨论了 FaaS 提供商如何应对冷启动问题以及可能的未来方向。

关键词

引用

@article{arxiv.2411.15664,
  title  = {Enabling Efficient Serverless Inference Serving for LLM (Large Language Model) in the Cloud},
  author = {Himel Ghosh},
  journal= {arXiv preprint arXiv:2411.15664},
  year   = {2024}
}

备注

12 pages, 7 figures, TUM Cloud Computing Seminar