中文

具有拜占庭式工作节点与服务器的快速机器学习

机器学习 2020-07-21 v3 机器学习

摘要

当今的机器学习(ML)解决方案多为分布式,且容易出现各类组件故障,这些故障可概括为所谓的拜占庭式(Byzantine)行为。本文提出 LiuBei,一种拜占庭弹性的 ML 算法,它不信任网络中的任何单个组件(既不信工作节点也不信服务器),并且与标准的非拜占庭弹性算法相比,也不会(平均上)引入额外的通信轮次。LiuBei 基于梯度聚合规则(GARs)来容忍少数拜占庭式工作节点。此外,LiuBei 将参数服务器在多台机器上复制而非信任单一服务器。我们引入一种新颖的过滤机制,使工作节点能够过滤出来自拜占庭式服务器副本的回复,而无需与所有服务器通信。该过滤机制基于网络同步性、损失函数的 Lipschitz 连续性,以及用于聚合工作节点梯度的 GAR。我们还引入一种 scatter/gather 协议,以用少量通信消息限制正确服务器间模型的漂移。我们从理论上证明 LiuBei 对服务器和工作节点均实现拜占庭弹性并保证收敛。我们使用 TensorFlow 构建 LiuBei,并表明与原始 TensorFlow 相比,LiuBei 在约 5% 的精度损失和约 24% 的收敛开销下容忍拜占庭行为。我们还表明,与另一种最先进的(假设网络异步的)拜占庭弹性 ML 算法相比,LiuBei 的吞吐量增益为 70%。

关键词

引用

@article{arxiv.1911.07537,
  title  = {Fast Machine Learning with Byzantine Workers and Servers},
  author = {El Mahdi El Mhamdi and Rachid Guerraoui and Arsany Guirguis},
  journal= {arXiv preprint arXiv:1911.07537},
  year   = {2020}
}

备注

This paper has been merged with arXiv:1905.03853, which has been accepted to appear in the ACM Symposium on Principles of Distributed Computing (PODC) 2020