MalleTrain:针对不可填充 supercomputer 节点的深度神经网络训练
分布式、并行与集群计算
2024-04-25 v1
摘要
先到先服务的调度会导致supercomputer上约10%的节点暂时闲置。鉴于此类未被填充的节点非常适合进行深度神经网络(DNN)训练,由于DNN训练任务具有灵活性,Liu等人提出应将DNN训练任务的规模调整以适配日程中的空隙,建模为混合整数线性规划(MILP)问题,并通过仿真演示了该方法的潜在优势。本文引入MalleTrain,是一个为此方法提供实际实现的系统,并且进一步推广了其方法,使其可用于运行时模型信息未知的DNN训练应用。其核心创新在于采用轻量级在线作业概谱顾问(JPA)收集DNN作业的关键可扩展性信息,并据此实时动态优化资源分配。我们描述了MalleTrain体系结构,并在supercomputer GPU集群上对几组代表性DNN训练工作负载进行详细实验评估,包括神经网络结构搜索和超参数优化。我们的结果不仅确认了利用闲置supercomputer节点进行DNN训练的实际可行性,还在先前结果方面实现了显著改进,通过无需用户提供作业可扩展性信息,提高了训练吞吐量最高可达22.3%。
引用
@article{arxiv.2404.15668,
title = {MalleTrain: Deep Neural Network Training on Unfillable Supercomputer Nodes},
author = {Xiaolong Ma and Feng Yan and Lei Yang and Ian Foster and Michael E. Papka and Zhengchun Liu and Rajkumar Kettimuthu},
journal= {arXiv preprint arXiv:2404.15668},
year = {2024}
}