中文

关于缩放符号梯度下降的更快收敛性

最优化与控制 2021-09-07 v1 机器学习

摘要

在大规模网络上的工业应用中,通信已被视为显著瓶颈。为缓解通信负担,基于符号的优化算法近来在工业界与学术界广受欢迎,其被证明与自适应梯度方法(如Adam)密切相关。沿此方向,本文研究了称为缩放signGD的基于符号的梯度下降变体在三种情形下的更快收敛性:1)目标函数强凸;2)目标函数非凸但满足Polyak-Lojasiewicz(PL)不等式;3)梯度为随机的,此时称为缩放signGD。对于前两种情形,可证明缩放signGD以线性速率收敛。对于情形3),当采用恒定学习率时,算法被证明线性收敛到最优值的一个邻域;当采用递减学习率时,算法以 O(1/k)O(1/k) 的速率收敛,其中 kk 为迭代次数。结果还通过参数服务器框架中的多数投票扩展到分布式设置。最后,在逻辑回归上进行了数值实验以佐证理论发现。

关键词

引用

@article{arxiv.2109.01806,
  title  = {On Faster Convergence of Scaled Sign Gradient Descent},
  author = {Xiuxian Li and Kuo-Yi Lin and Li Li and Yiguang Hong and Jie Chen},
  journal= {arXiv preprint arXiv:2109.01806},
  year   = {2021}
}