signSGD:面向非凸问题的压缩优化
机器学习
2018-08-09 v3 分布式、并行与集群计算
最优化与控制
摘要
训练大型神经网络需要将学习分布到多个工作节点上,而通信梯度的代价可能成为一个显著的瓶颈。signSGD 通过仅传输每个小批量随机梯度的符号来缓解此问题。我们证明它能够兼得两者之长:压缩梯度与 SGD 级别的收敛速率。梯度的相对 几何结构、噪声与曲率决定了 signSGD 还是 SGD 在理论上更适用于特定问题。在实践方面,我们发现 signSGD 的动量对应版本能够在深度 ImageNet 模型上匹配 Adam 的精度与收敛速度。我们将理论推广至分布式设定,其中参数服务器利用多数投票聚合各工作节点的梯度符号,从而实现工作节点与服务器双向通信的 1-bit 压缩。利用高斯的一个定理,我们证明多数投票能够达到与全精度分布式 SGD 相同的方差缩减。因此,基于符号的优化方案在实现快速通信与快速收敛方面大有前景。复现实验的代码见 https://github.com/jxbz/signSGD 。
引用
@article{arxiv.1802.04434,
title = {signSGD: Compressed Optimisation for Non-Convex Problems},
author = {Jeremy Bernstein and Yu-Xiang Wang and Kamyar Azizzadenesheli and Anima Anandkumar},
journal= {arXiv preprint arXiv:1802.04434},
year = {2018}
}