中文

基于代理模型序列长度预测的高效交互式 LLM 服务

分布式、并行与集群计算 2024-11-26 v2 计算与语言 机器学习

摘要

大型语言模型在众多领域推动了新一波交互式 AI 应用。然而,由于生成模型自回归特性导致的不可预测执行时间,高效地服务 LLM 推理请求面临挑战。现有的 LLM 服务系统采用先来先服务(FCFS)调度,存在队头阻塞问题。为了解决 LLM 的非确定性并实现高效的交互式 LLM 服务,我们提出了一种推测最短作业优先(SSJF)调度器,该调度器使用轻量级代理模型来预测 LLM 输出序列长度。我们的开源 SSJF 实现不需要更改内存管理或批处理策略。在真实世界数据集和生产工作负载追踪上的评估表明,在无批处理、动态批处理和连续批处理设置下,与 FCFS 调度器相比,SSJF 将平均作业完成时间减少了 30.5-39.6%,并将吞吐量提高了 2.2-3.6 倍。

关键词

引用

@article{arxiv.2404.08509,
  title  = {Efficient Interactive LLM Serving with Proxy Model-based Sequence Length Prediction},
  author = {Haoran Qiu and Weichao Mao and Archit Patke and Shengkun Cui and Saurabh Jha and Chen Wang and Hubertus Franke and Zbigniew T. Kalbarczyk and Tamer Başar and Ravishankar K. Iyer},
  journal= {arXiv preprint arXiv:2404.08509},
  year   = {2024}
}

备注

Accepted at AIOps'24