通过 SGD 与量化 SGD 拟合 ReLU
机器学习
2019-04-02 v2 分布式、并行与集群计算
信息论
math.IT
机器学习
摘要
本文聚焦于寻找由单个 Rectified Linear Unit (ReLU) 组成的最浅层神经网络的最优权重问题。这些函数的形式为 ,其中 表示权重向量。我们关注一个植入模型,其中输入从高斯分布中独立同分布选取,标签根据植入的权重向量生成。我们首先证明,在适当初始化的情况下,mini-batch stochastic gradient descent 以几何速率收敛至植入模型,且所需样本数在数值常数范围内是最优的。接下来,我们关注并行实现,其中每次迭代的 mini-batch 梯度在多个处理器上以分布式方式计算,然后广播至主处理器或所有其他处理器。为减少此设置中的通信开销,我们采用 Quantized Stochastic Gradient Scheme (QSGD),其中部分梯度被量化。或许出乎意料的是,我们证明了 QSGD 在显著降低通信开销的同时,保持了 SGD 向全局最优模型的快速收敛。我们进一步通过包括在 Amazon EC2 上的分布式实现在内的各种实验验证了我们的数值结果。
引用
@article{arxiv.1901.06587,
title = {Fitting ReLUs via SGD and Quantized SGD},
author = {Seyed Mohammadreza Mousavi Kalan and Mahdi Soltanolkotabi and A. Salman Avestimehr},
journal= {arXiv preprint arXiv:1901.06587},
year = {2019}
}