Sponge:使用原位垂直扩展实现具有动态 SLO 的推理服务
分布式、并行与集群计算
2024-04-24 v2
摘要
移动和物联网应用日益采用深度学习推理以提供智能功能。推理请求通常通过高度可变的无线网络发送到云基础设施,导致在请求级别面临动态服务水平目标(SLO)的挑战。本文提出了 Sponge,一种新型深度学习推理服务系统,通过原位垂直扩展、动态批处理和请求重排序实现资源效率最大化,同时保证动态 SLO。Sponge 通过引入整数规划(Integer Programming)模型来捕捉资源分配问题,提供了延迟、批处理规模和资源之间关系的数学模型。我们通过原型实现和初步实验演示了 Sponge 的潜力,并讨论了未来工作。
引用
@article{arxiv.2404.00704,
title = {Sponge: Inference Serving with Dynamic SLOs Using In-Place Vertical Scaling},
author = {Kamran Razavi and Saeid Ghafouri and Max Mühlhäuser and Pooyan Jamshidi and Lin Wang},
journal= {arXiv preprint arXiv:2404.00704},
year = {2024}
}