通过生成长度预测实现LMaaS的高效批量服务
分布式、并行与集群计算
2024-06-10 v1
摘要
如今,大型语言模型作为服务发布,可以通过API被各种应用程序访问,也称为语言模型即服务(LMaaS)。由于不知道请求的生成长度,现有服务系统以先来先服务(FCFS)的方式以固定批量大小服务请求,这导致了影响批量服务效率的两个问题。首先,一批中请求的生成长度不同,短生成长度的请求必须等待长生成长度的请求完成。其次,生成长度较长的请求在服务过程中消耗更多内存。在不知道批量请求的生成长度的情况下,批量大小总是设置得很小以避免内存溢出错误,从而阻止GPU被充分利用。在本文中,我们发现LMaaS场景中大量流行应用的生成长度与原始用户输入长度之间存在正相关。基于这一观察,我们提出了Magnus,它可以利用用户输入长度、应用级和用户级语义特征准确预测请求生成长度。因此,Magnus可以通过将相似生成长度的请求分批并采用自适应批量大小来实现高请求吞吐量。此外,Magnus还可以使用最高响应比优先(HRRN)策略调度批次以减少请求响应时间。在我们的测试平台上进行的实验表明,与基线相比,Magnus将请求吞吐量提高了高达234%,并将响应时间减少了高达89.7%。
引用
@article{arxiv.2406.04785,
title = {Enabling Efficient Batch Serving for LMaaS via Generation Length Prediction},
author = {Ke Cheng and Wen Hu and Zhi Wang and Peng Du and Jianguo Li and Sheng Zhang},
journal= {arXiv preprint arXiv:2406.04785},
year = {2024}
}
备注
12 pages, 14 figures