中文

符号梯度下降的几何性质

机器学习 2020-02-20 v1 机器学习

摘要

基于符号的优化方法因其在分布式优化中良好的通信代价以及在神经网络训练中令人惊讶的良好表现,在机器学习中变得流行。此外,它们与所谓 Adam 等自适应梯度方法密切相关。近期关于 signSGD 的工作使用了非标准的“可分离光滑性”假设,而一些较早的工作将符号梯度下降研究为关于 \ell_\infty-范数的最速下降。在本工作中,我们通过展示可分离光滑性与 \ell_\infty-光滑性之间的紧密联系来统一这些现有结果,并论证后者是更弱且更自然的假设。我们进而研究关于 \ell_\infty-范数的光滑性常数,从而分离出影响基于符号方法性能的目标函数的几何性质。简而言之,我们发现当 (i) Hessian 在某种程度上集中于其对角线上,且 (ii) 其最大特征值远大于平均特征值时,基于符号的方法优于梯度下降。这两种性质在深度网络中都很常见。

关键词

引用

@article{arxiv.2002.08056,
  title  = {The Geometry of Sign Gradient Descent},
  author = {Lukas Balles and Fabian Pedregosa and Nicolas Le Roux},
  journal= {arXiv preprint arXiv:2002.08056},
  year   = {2020}
}