中文

BOA Constrictor: 通过预算最优分配从GPU云端提取性能

分布式、并行与集群计算 2026-02-03 v1

摘要

过去十年间,为机器学习(ML)模型训练需求GPU的需求呈现显著增长。由于大多数组织不具备构建和维护大型GPU集群的高昂成本,组织倾向于从云服务提供商租用GPU。客户需制定策略:(i) 在每个时刻决定租用多少GPU以处理流式ML训练任务,(ii) 将租用的GPU在当前活跃任务之间分配。由于ML训练任务可在不同数量的GPU上并行,客户通常有多种选择为每个任务选择多少GPU。将更多GPU分配给单个训练任务会使任务完成得更快。然而,客户为每个GPU时长付费,训练任务在额外GPU上获得的边际收益呈递减。因此,过度分配GPU给单个任务会显著增加客户向云服务提供商支付的总成本。这导致客户在运行云端训练任务时必须权衡成本与性能之间的关系。为平衡这一成本-性能权衡,我们开发了BOA Constrictor,这是一种新的ML训练任务调度器,它使用预算最优分配(Budget-Optimal Allocation, BOA)策略,在固定预算约束下从云端部署的GPU集群中提取最高水平的性能。我们将问题明确形式化为预算受限的调度问题,并推导出BOA策略,以用户的预算为约束,最小化到达任务流的平均作业完成时间(Job Completion Time, JCT)。在给定预算水平下,我们表明,BOA Constrictor在小规模实验中可将平均JCT缩短1.6倍,在详细的大规模仿真中可缩短2倍。

关键词

引用

@article{arxiv.2602.01404,
  title  = {BOA Constrictor: Squeezing Performance out of GPUs in the Cloud via Budget-Optimal Allocation},
  author = {Zhouzi Li and Cindy Zhu and Arpan Mukhopadhyay and Mor Harchol-Balter and Benjamin Berg},
  journal= {arXiv preprint arXiv:2602.01404},
  year   = {2026}
}