使用随机梯度下降(SGD)与基于范数的比较梯度消除(CGE)的拜占庭容错分布式机器学习
机器学习
2021-04-20 v2 分布式、并行与集群计算
机器学习
摘要
本文考虑分布式随机梯度下降(D-SGD)方法中的拜占庭容错问题——这是一种流行的分布式多智能体机器学习算法。在该问题中,每个智能体从某一数据生成分布独立采样数据点。在无故障情况下,D-SGD方法使所有智能体学习到最能拟合所有智能体集体采样数据的数学模型。我们考虑一部分智能体可能为拜占庭故障的情况。此类故障智能体可能未正确遵循规定算法,并可能通过共享任意不正确的随机梯度使传统D-SGD方法失效。我们提出了一种基于范数的梯度过滤器,称为比较梯度消除(CGE),其使D-SGD方法对拜占庭智能体具有鲁棒性。我们证明,在标准随机假设下,CGE梯度过滤器保证了对有界比例拜占庭智能体的容错能力,且与许多现有梯度过滤器(如multi-KRUM、几何中值-of-均值和谱过滤器)相比计算更简单。我们通过神经网络上的分布式学习仿真经验表明,CGE的容错能力与现有梯度过滤器相当。我们还经验表明,随机梯度的指数平均提升了通用梯度过滤器的容错能力。
引用
@article{arxiv.2008.04699,
title = {Byzantine Fault-Tolerant Distributed Machine Learning Using Stochastic Gradient Descent (SGD) and Norm-Based Comparative Gradient Elimination (CGE)},
author = {Nirupam Gupta and Shuo Liu and Nitin H. Vaidya},
journal= {arXiv preprint arXiv:2008.04699},
year = {2021}
}
备注
The report includes 52 pages, and 16 figures. Extension of our prior work on Byzantine fault-tolerant distribution optimization (arXiv:1903.08752 and doi:10.1145/3382734.3405748) to Byzantine fault-tolerant distributed machine learning; Updated to the full version of workshop paper in DSN-DSML '21