中文

DRACO:基于冗余梯度的拜占庭容错分布式训练

机器学习 2018-06-25 v4 分布式、并行与集群计算 信息论 机器学习 神经与进化计算 math.IT

摘要

分布式模型训练容易受到拜占庭系统故障和对抗性计算节点(即使用恶意更新来破坏存储在参数服务器(PS)上的全局模型的节点)的影响。为了保证某种形式的鲁棒性,最近的工作建议使用几何中位数的变体作为聚合规则,以代替梯度平均。遗憾的是,在大规模环境下,基于中位数的规则可能会带来过高的计算开销,且其收敛性保证通常需要很强的假设。在本工作中,我们提出了 DRACO,这是一个利用编码理论思想的可扩展鲁棒分布式训练框架。在 DRACO 中,每个计算节点计算冗余梯度,参数服务器利用这些冗余梯度来消除对抗性更新的影响。DRACO 具有与问题无关的鲁棒性保证,其训练出的模型与在无对抗环境下训练的模型完全一致。我们在真实数据集和分布式环境下的多种大规模模型上进行了大量实验,结果表明 DRACO 比基于中位数的方法快数倍至数个数量级。

关键词

引用

@article{arxiv.1803.09877,
  title  = {DRACO: Byzantine-resilient Distributed Training via Redundant Gradients},
  author = {Lingjiao Chen and Hongyi Wang and Zachary Charles and Dimitris Papailiopoulos},
  journal= {arXiv preprint arXiv:1803.09877},
  year   = {2018}
}

备注

Accepted by ICML 2018