Bamboo:使可抢占实例具备韧性以低成本训练大型DNN
分布式、并行与集群计算
2022-04-27 v1 机器学习
摘要
许多领域的DNN模型规模持续增长,导致有效训练的高资源需求,以及跨规模的组织和研究实验室难以承受(且往往负担不起)的成本。本文旨在通过对可抢占实例的有效利用来显著降低训练成本,即可在空闲时以更便宜价格获得、但可能被优先级用户随时抢占的实例。然而,这样做需要新形式的韧性和效率来应对频繁抢占的可能性——这是一种与正常集群环境中偶发故障截然不同的故障模型,而现有检查点技术正针对后者。我们提出Bamboo,一个通过向训练流水线引入冗余计算来应对这些挑战的分布式系统,即一个节点不仅计算自身层,还计算其邻居的部分层。我们的核心见解是,训练大型模型常需要流水线并行,其中“流水线气泡”自然存在。Bamboo小心地将冗余计算填入这些气泡中,以低成本提供韧性。在多种广泛使用的DNN模型上,Bamboo在训练吞吐量上比传统检查点高3.7倍,并且相比使用按需实例的设置成本降低2.4倍。
引用
@article{arxiv.2204.12013,
title = {Bamboo: Making Preemptible Instances Resilient for Affordable Training of Large DNNs},
author = {John Thorpe and Pengzhan Zhao and Jonathan Eyolfson and Yifan Qiao and Zhihao Jia and Minjia Zhang and Ravi Netravali and Guoqing Harry Xu},
journal= {arXiv preprint arXiv:2204.12013},
year = {2022}
}
备注
17 pages