中文

D$^2$:去中心化数据上的去中心化训练

分布式、并行与集群计算 2018-04-23 v2 机器学习 机器学习

摘要

在使用多个 worker 训练机器学习模型时,每个 worker 从各自的数据源收集数据,如果不同 worker 收集的数据是独特且不同的,那将是最有用的。讽刺的是,最近对去中心化并行随机梯度下降(D-PSGD)的分析依赖于不同 worker 上托管的数据差异不大的假设。在本文中,我们提出问题:我们能否设计一种对 worker 间数据方差不太敏感的去中心化并行随机梯度下降算法?在本文中,我们提出了 D2^2,一种新颖的去中心化并行随机梯度下降算法,专为 worker 间的大数据方差(不严谨地称为“去中心化”数据)设计。D2^2 的核心是标准 D-PSGD 算法的方差缩减扩展,它将收敛速度从 O(σnT+(nζ2)13T2/3)O\left({\sigma \over \sqrt{nT}} + {(n\zeta^2)^{\frac{1}{3}} \over T^{2/3}}\right) 提高到 O(σnT)O\left({\sigma \over \sqrt{nT}}\right),其中 ζ2\zeta^{2} 表示不同 worker 上数据的方差。因此,D2^2 对 worker 间的数据方差具有鲁棒性。我们在每个 worker 只能访问有限标签集数据的图像分类任务上对 D2^2 进行了实证评估,发现 D2^2 显著优于 D-PSGD。

关键词

引用

@article{arxiv.1803.07068,
  title  = {D$^2$: Decentralized Training over Decentralized Data},
  author = {Hanlin Tang and Xiangru Lian and Ming Yan and Ce Zhang and Ji Liu},
  journal= {arXiv preprint arXiv:1803.07068},
  year   = {2018}
}