D$^2$:去中心化数据上的去中心化训练
分布式、并行与集群计算
2018-04-23 v2 机器学习
机器学习
摘要
在使用多个 worker 训练机器学习模型时,每个 worker 从各自的数据源收集数据,如果不同 worker 收集的数据是独特且不同的,那将是最有用的。讽刺的是,最近对去中心化并行随机梯度下降(D-PSGD)的分析依赖于不同 worker 上托管的数据差异不大的假设。在本文中,我们提出问题:我们能否设计一种对 worker 间数据方差不太敏感的去中心化并行随机梯度下降算法?在本文中,我们提出了 D,一种新颖的去中心化并行随机梯度下降算法,专为 worker 间的大数据方差(不严谨地称为“去中心化”数据)设计。D 的核心是标准 D-PSGD 算法的方差缩减扩展,它将收敛速度从 提高到 ,其中 表示不同 worker 上数据的方差。因此,D 对 worker 间的数据方差具有鲁棒性。我们在每个 worker 只能访问有限标签集数据的图像分类任务上对 D 进行了实证评估,发现 D 显著优于 D-PSGD。
引用
@article{arxiv.1803.07068,
title = {D$^2$: Decentralized Training over Decentralized Data},
author = {Hanlin Tang and Xiangru Lian and Ming Yan and Ce Zhang and Ji Liu},
journal= {arXiv preprint arXiv:1803.07068},
year = {2018}
}