中文

Parle:并行化随机梯度下降

机器学习 2017-09-12 v2 分布式、并行与集群计算 机器学习

摘要

我们提出一种称为 Parle 的新算法,用于深度网络的并行训练,其收敛速度比随机梯度下降(SGD)的数据并行实现快 2-4 倍,同时在包括 CIFAR-10 和 CIFAR-100 在内的多个基准上实现了接近最先进(state-of-the-art)的显著改善的错误率,且不引入任何额外的超参数。我们利用已被证明可导致深度网络泛化误差改善的平坦极小值现象。Parle 需要与参数服务器非常不频繁的通信,而是在每个客户端上执行更多计算,这使其非常适合单机器多 GPU 设置和分布式实现。

关键词

引用

@article{arxiv.1707.00424,
  title  = {Parle: parallelizing stochastic gradient descent},
  author = {Pratik Chaudhari and Carlo Baldassi and Riccardo Zecchina and Stefano Soatto and Ameet Talwalkar and Adam Oberman},
  journal= {arXiv preprint arXiv:1707.00424},
  year   = {2017}
}