中文

Faro:面向本地容器化ML推理集群的SLO感知系统

分布式、并行与集群计算 2024-10-01 v1

摘要

本文解决了在资源受限的本地生产集群上,于时变工作负载下运行多个ML推理任务(模型)的挑战。我们的系统Faro接收每个任务的延迟服务等级目标(SLO),自动将其提炼为效用函数,对这些效用函数进行“松弛化”处理以使其适用于数学优化,通过概率预测自动预测工作负载,并动态进行隐式的跨任务资源分配,以满足集群级目标,例如总效用、公平性及其他混合变体。Faro应对的一个主要挑战是,使用精确的效用和高保真预测器对于我们所要求的快速自适应来说可能过于缓慢(在某种意义上也过于精确!)。Faro的解决方案是对其多个设计组件进行“松弛化”(放宽),以在不严重降低解质量的前提下实现快速自适应。Faro在一个由运行于Kubernetes集群之上的Ray Serve组成的栈中实现。基于轨迹的集群部署表明,与最先进的系统相比,Faro实现了2.3倍至23倍的更低的SLO违反率。

关键词

引用

@article{arxiv.2409.19488,
  title  = {A House United Within Itself: SLO-Awareness for On-Premises Containerized ML Inference Clusters via Faro},
  author = {Beomyeol Jeon and Chen Wang and Diana Arroyo and Alaa Youssef and Indranil Gupta},
  journal= {arXiv preprint arXiv:2409.19488},
  year   = {2024}
}

备注

13 pages, 16 figures, To appear in Eurosys 2025