SuperServe:面向不可预测负载的细粒度推理服务
分布式、并行与集群计算
2023-12-29 v1 机器学习
摘要
在数据中心和边缘的生产应用关键路径上日益增加的 ML 模型部署,要求 ML 推理服务系统能够在不可预测和突发的请求到达率下为这些模型提供服务。在这种条件下服务模型要求这些系统在应用的延迟和准确性要求与稀缺资源的整体利用效率之间取得谨慎的平衡。SOTA 系统通过选择延迟-准确性权衡空间中的一个静态点来服务所有请求,或者在请求服务的关键路径上加载特定模型来解决这种矛盾。在这项工作中,我们通过同时服务跨越延迟-准确性权衡空间的整个范围的模型来解决这一矛盾。我们的新机制 SubNetAct 通过在权重共享的 SuperNetworks 中仔细插入专用算子来实现这一点。这些算子使 SubNetAct 能够通过网络动态路由请求,以满足延迟和准确性目标。与先前的 SOTA 相比,SubNetAct 服务大量模型所需的内存最多可降低 2.6 倍。此外,SubNetAct 近乎瞬时的模型驱动解锁了细粒度、响应式调度策略的设计空间。我们探索了一种此类极其有效的策略 SlackFit 的设计,并在实际系统 SuperServe 中实例化了 SubNetAct 和 SlackFit。在源自真实世界 Microsoft Azure Functions 负载的追踪上,SuperServe 在相同 SLO 达标率下实现了 4.67% 的更高准确率,在相同准确率下实现了 2.85 倍的更高 SLO 达标率,并在各种极度突发的合成追踪上自动产生最佳权衡。
引用
@article{arxiv.2312.16733,
title = {SuperServe: Fine-Grained Inference Serving for Unpredictable Workloads},
author = {Alind Khare and Dhruv Garg and Sukrit Kalra and Snigdha Grandhi and Ion Stoica and Alexey Tumanov},
journal= {arXiv preprint arXiv:2312.16733},
year = {2023}
}