DETOX:一种基于冗余的更快速且更鲁棒的梯度聚合框架
机器学习
2020-03-10 v2 分布式、并行与集群计算
机器学习
摘要
为提高分布式训练对最坏情况或拜占庭(Byzantine)节点故障的弹性,近期的若干方法用鲁棒聚合方法替代了梯度平均。此类技术可能具有高计算成本(通常为计算节点数的二次方),且仅有有限的鲁棒性保证。其他方法则使用冗余来保证鲁棒性,但只能容忍有限数量的拜占庭故障。在本文中,我们提出 DETOX,一种结合算法冗余与鲁棒聚合的拜占庭弹性分布式训练框架。DETOX 分两步操作:一个利用有限冗余显著削弱拜占庭节点影响的过滤步骤,以及一个可与任何最先进鲁棒聚合方法协同使用的分层聚合步骤。我们从理论上证明,这带来了鲁棒性的大幅提升,且每次迭代的运行时间可近乎随计算节点数线性增长。我们在多种大规模机器学习任务的实际分布式设置上进行了广泛实验,表明 DETOX 相较于许多最先进的拜占庭弹性方法带来了数量级的准确率和加速提升。
引用
@article{arxiv.1907.12205,
title = {DETOX: A Redundancy-based Framework for Faster and More Robust Gradient Aggregation},
author = {Shashank Rajput and Hongyi Wang and Zachary Charles and Dimitris Papailiopoulos},
journal= {arXiv preprint arXiv:1907.12205},
year = {2020}
}