应对分布式深度学习中工作节点故障的动态权重策略
机器学习
2024-09-17 v1 分布式、并行与集群计算
摘要
深度学习模型的日益复杂以及对处理海量数据的需求,使得高效训练所需的大规模分布式系统成为必然。然而,这些系统面临着显著挑战,如通信开销、硬件限制和节点故障。本文研究了分布式深度学习中的各种优化技术,包括弹性平均随机梯度(EASGD)和二阶方法 AdaHessian。我们提出了一种动态权重策略,以增强应对因故障导致的迟缓节点问题,提高整体训练过程的性能和效率。我们通过不同工作节点数和通信周期的实验,展示了该策略在改进收敛速度和测试性能方面的效果。
关键词
引用
@article{arxiv.2409.09242,
title = {A Dynamic Weighting Strategy to Mitigate Worker Node Failure in Distributed Deep Learning},
author = {Yuesheng Xu and Arielle Carr},
journal= {arXiv preprint arXiv:2409.09242},
year = {2024}
}