中文

协调推理服务系统的高精度、成本效率与低延迟

机器学习 2023-05-22 v2 分布式、并行与集群计算 系统与控制 系统与控制

摘要

机器学习(ML)推理在各种应用中的使用正急剧增长。ML 推理服务直接与用户交互,需要快速且准确的响应。此外,这些服务面临动态的请求工作负载,对其计算资源造成变化。未能正确调整计算资源规模会导致延迟服务级别目标(SLO)违规或计算资源浪费。在考虑准确性、延迟和资源成本所有要素的情况下适应动态工作负载具有挑战性。为应对这些挑战,我们提出 InfAdapter,它主动选择一组 ML 模型变体及其资源分配,以满足延迟 SLO,同时最大化由准确性和成本构成的目标函数。与流行的工业自动缩放器(Kubernetes Vertical Pod Autoscaler)相比,InfAdapter 将 SLO 违规和成本分别降低多达 65% 和 33%。

关键词

引用

@article{arxiv.2304.10892,
  title  = {Reconciling High Accuracy, Cost-Efficiency, and Low Latency of Inference Serving Systems},
  author = {Mehran Salmani and Saeid Ghafouri and Alireza Sanaee and Kamran Razavi and Max Mühlhäuser and Joseph Doyle and Pooyan Jamshidi and Mohsen Sharifi},
  journal= {arXiv preprint arXiv:2304.10892},
  year   = {2023}
}