中文

Scavenger:一种优化机器学习训练成本与性能的云服务

分布式、并行与集群计算 2023-12-06 v1 机器学习

摘要

尽管云虚拟机(VM)的按需付费特性使得为训练 ML 模型快速启动大型集群变得容易,但也可能导致成本急剧膨胀。云平台提供的数百种虚拟机规格也使得为训练选择“合适”的云集群配置极为困难。此外,分布式模型训练的训练时间与成本对集群配置高度敏感,并呈现一个庞大而复杂的权衡空间。在本文中,我们开发了有原则且实用的技术,用于在云上优化分布式 ML 模型训练的训练时间与成本。我们的核心见解是,在选择最优作业配置参数(如工作节点数与批大小)时必须同时考虑并行效率与统计效率。通过结合传统的并行扩展概念与对 SGD 噪声的新见解,我们的模型以小于 5% 的误差准确估计不同集群配置上的时间与成本。利用训练的重复性与我们的模型,我们得以以黑盒、在线方式搜索最优云配置。我们的方法将训练时间减少 2 倍,成本降低超过 50%。相较于基于 oracle 的方法,我们的性能模型准确至 2% 以内,从而使得搜索仅带来 10% 的开销。

关键词

引用

@article{arxiv.2303.06659,
  title  = {Scavenger: A Cloud Service for Optimizing Cost and Performance of ML Training},
  author = {Sahil Tyagi and Prateek Sharma},
  journal= {arXiv preprint arXiv:2303.06659},
  year   = {2023}
}