Parcae:在可抢占实例上主动优化实时吞吐量的 DNN 训练
分布式、并行与集群计算
2024-03-22 v1
摘要
深度神经网络 (DNN) 正变得日益庞大且训练成本高昂。本文旨在通过利用现代云平台上的可抢占实例来降低 DNN 训练成本,这些实例在空闲时可以以低得多的价格分配,但可能随时被云提供商抢占。先前支持在可抢占实例上进行 DNN 训练的工作采用被动式方法来处理实例抢占和分配事件,这只能实现有限的性能和可扩展性。我们提出了 Parcae,一个通过在实例抢占和分配实际发生之前主动调整 DNN 训练作业的并行化策略以适应预测的资源变化,从而在可抢占实例上实现廉价、快速和可扩展的 DNN 训练的系统,这显著降低了处理这些事件的成本。Parcae 优化了 liveput,这是一个衡量 DNN 作业在各种可能抢占场景下预期训练吞吐量的新颖指标。与现有的反应式、吞吐量优化系统相比,Parcae 的主动式、实时优化解决方案同时考虑了作业的吞吐量及其在抢占下的鲁棒性。为了优化 liveput,Parcae 支持轻量级实例迁移,并使用可用性预测器来预测未来的抢占。然后,它使用 liveput 优化器来发现一种在预测的抢占下并行化 DNN 训练的最优策略。我们在多种 DNN 和抢占轨迹上评估了 Parcae,结果表明 Parcae 的性能比现有的竞价实例 DNN 训练系统高出多达 10 倍。更重要的是,Parcae 在频繁抢占下训练大型 DNN 时实现了接近最优的性能,而现有方法在这种情况下无法取得任何进展。
引用
@article{arxiv.2403.14097,
title = {Parcae: Proactive, Liveput-Optimized DNN Training on Preemptible Instances},
author = {Jiangfei Duan and Ziang Song and Xupeng Miao and Xiaoli Xi and Dahua Lin and Harry Xu and Minjia Zhang and Zhihao Jia},
journal= {arXiv preprint arXiv:2403.14097},
year = {2024}
}
备注
NSDI '24