面向并行机器学习的动态备份工作节点
分布式、并行与集群计算
2021-01-26 v2 机器学习
摘要
机器学习模型分布式训练最流行的框架是(同步)参数服务器(PS)。该范式由 个工作节点组成,它们迭代地计算模型参数的更新,以及一个有状态的 PS,其等待并聚合所有更新以生成模型参数的新估计,并将其发回给工作节点进行新一轮迭代。瞬态计算减速或传输延迟会不可容忍地拉长每次迭代的时间。缓解此问题的一个高效方法是让 PS 在生成新参数前仅等待最快的 个更新。最慢的 个工作节点称为备份工作节点。最优备份工作节点数 取决于集群配置与工作负载,而且还(如本文所示)取决于学习算法的超参数以及训练当前阶段。我们提出 DBW,一种在训练过程中动态决定备份工作节点数量以最大化每次迭代收敛速度的算法。我们的实验表明,DBW 1)免除了通过耗时的预实验来调参 的必要,2)使训练比最优静态配置快至多 倍。
引用
@article{arxiv.2004.14696,
title = {Dynamic backup workers for parallel machine learning},
author = {Chuan Xu and Giovanni Neglia and Nicola Sebastianelli},
journal= {arXiv preprint arXiv:2004.14696},
year = {2021}
}
备注
Journal version