中文

StraightLine:面向机器学习应用请求的端到端资源感知调度器

分布式、并行与集群计算 2024-09-09 v2 机器学习

摘要

机器学习(ML)应用的生命周期包含两个阶段:模型开发和模型部署。然而,传统机器学习系统(如训练专用或推理专用系统)往往只关注生命周期中的某个特定阶段。这些系统常常致力于优化模型训练或加速模型推理,并且频繁假设基础设施均质化,这可能不符合实际场景,即云数据中心、本地服务器、容器和无服务器平台的混合环境。我们提出StraightLine,一种端到端资源感知调度器,为混合基础设施中的不同机器学习应用请求调度最优资源(如容器、虚拟机或无服务器)。其核心创新在于一种经验性动态放置算法,能够根据请求的独特特征(如请求频率、输入数据大小和数据分布)智能地进行放置。与现有机器学习系统不同,StraightLine提供端到端的资源感知放置,从而在面对混合基础设施中的不同计算资源时,可显著降低模型部署的响应时间和失败率。

关键词

引用

@article{arxiv.2407.18148,
  title  = {StraightLine: An End-to-End Resource-Aware Scheduler for Machine Learning Application Requests},
  author = {Cheng-Wei Ching and Boyuan Guan and Hailu Xu and Liting Hu},
  journal= {arXiv preprint arXiv:2407.18148},
  year   = {2024}
}

备注

6 pages, 8 figures, to appear in AIoTC'24