中文

基于学习的尽力而为型大语言模型服务

机器学习 2024-07-16 v2 人工智能 计算与语言 分布式、并行与集群计算

摘要

许多应用必须为用户提供低延迟的大语言模型(LLM)服务,否则将面临不可接受的用户体验。然而,为应对波动的请求模式而过度配置资源往往成本高昂得令人望而却步。在本工作中,我们提出了一种尽力而为的服务系统,该系统采用深度强化学习,根据任务分布和系统负载来调整服务质量。我们的尽力而为系统能够在客户端请求速率提高10倍以上的情况下维持可用性,在不可预测的工作负载上,其性能达到峰值96%以上的频率是静态服务的4.1倍,达到峰值98%以上的频率是静态服务的2.3倍。我们学习到的路由器对请求到达分布和任务分布的变化都具有鲁棒性。与静态服务相比,基于学习的尽力而为服务通过提高硬件利用率实现了成本效益高的服务。此外,我们认为基于学习的尽力而为型LLM服务适用于多种场景,并为应用开发者提供了极大的灵活性,以满足其特定需求。

关键词

引用

@article{arxiv.2401.07886,
  title  = {Learned Best-Effort LLM Serving},
  author = {Siddharth Jha and Coleman Hooper and Xiaoxuan Liu and Sehoon Kim and Kurt Keutzer},
  journal= {arXiv preprint arXiv:2401.07886},
  year   = {2024}
}

备注

Es-FoMo @ ICML 2024