Parle:并行化随机梯度下降
机器学习
2017-09-12 v2 分布式、并行与集群计算
机器学习
摘要
我们提出一种称为 Parle 的新算法,用于深度网络的并行训练,其收敛速度比随机梯度下降(SGD)的数据并行实现快 2-4 倍,同时在包括 CIFAR-10 和 CIFAR-100 在内的多个基准上实现了接近最先进(state-of-the-art)的显著改善的错误率,且不引入任何额外的超参数。我们利用已被证明可导致深度网络泛化误差改善的平坦极小值现象。Parle 需要与参数服务器非常不频繁的通信,而是在每个客户端上执行更多计算,这使其非常适合单机器多 GPU 设置和分布式实现。
引用
@article{arxiv.1707.00424,
title = {Parle: parallelizing stochastic gradient descent},
author = {Pratik Chaudhari and Carlo Baldassi and Riccardo Zecchina and Stefano Soatto and Ameet Talwalkar and Adam Oberman},
journal= {arXiv preprint arXiv:1707.00424},
year = {2017}
}