中文

在 NRP Nautilus HyperCluster 上利用 Kubernetes 扩展深度学习研究

机器学习 2024-11-20 v1 人工智能 分布式、并行与集群计算

摘要

在整个科学计算领域,深度学习算法在广泛的应用中展现出了卓越的性能。随着这些深度神经网络 (DNN) 的不断成熟,训练它们所需的计算量也在持续增长。如今,现代 DNN 需要数百万次 FLOPs 以及数天到数周的训练才能生成一个训练良好的模型。DNN 所需的训练时间在各种深度学习应用的 DNN 研究中往往是瓶颈,因此,加速和扩展 DNN 训练能够实现更稳健、更快速的研究。为此,在这项工作中,我们探索利用 NRP Nautilus HyperCluster 来自动化和扩展 DNN 的三个独立应用的深度学习模型训练,包括头顶目标检测、火烧区域分割和森林砍伐检测。总共有 234 个深度神经模型在 Nautilus 上进行训练,总耗时 4,040 小时。

关键词

引用

@article{arxiv.2411.12038,
  title  = {Scaling Deep Learning Research with Kubernetes on the NRP Nautilus HyperCluster},
  author = {J. Alex Hurt and Anes Ouadou and Mariam Alshehri and Grant J. Scott},
  journal= {arXiv preprint arXiv:2411.12038},
  year   = {2024}
}