中文

Aladdin:面向SLO感知的LLM推理联合放置与扩缩

分布式、并行与集群计算 2024-05-14 v1

摘要

大语言模型(LLM)推理需求正逐渐主导人工智能工作负载,因此迫切需要成本效益高的推理服务。现有工作侧重于单工作进程优化,缺乏对推理查询和计算资源的集群级管理。然而,在不考虑查询特征的情况下放置请求和管理资源,容易导致SLO违规或资源 underutilization。供应商被迫为保证用户体验分配额外计算资源,从而导致额外的服务成本。本文引入Aladdin,一种能够联合适应性地放置查询和扩缩计算资源的调度器,具有SLO感知能力。对于一流的推理查询,Aladdin首先预测满足所有查询SLO所需的最小计算资源以及相应的服务工作进程配置。然后,根据批量LLM推理的预填充和解码时延模型,将查询放置到每个服务工作进程,以最大化每个工作进程的利用率。结果表明,与基线方法相比,Aladdin在保持相同SLO水平下,可将单一模型的服务成本降低最高可达71%,这相当于每年数百万美元的节省。

关键词

引用

@article{arxiv.2405.06856,
  title  = {Aladdin: Joint Placement and Scaling for SLO-Aware LLM Serving},
  author = {Chengyi Nie and Rodrigo Fonseca and Zhenhua Liu},
  journal= {arXiv preprint arXiv:2405.06856},
  year   = {2024}
}