中文

LSH采样打破自适应随机梯度估计中的计算鸡生蛋蛋生鸡循环

机器学习 2019-11-01 v1 最优化与控制 机器学习

摘要

随机梯度下降(SGD)是大规模问题中最流行的优化算法。SGD通过样本量为1的均匀采样来估计梯度。已有若干工作建议通过使用加权非均匀采样以获得更好的梯度估计,从而实现更快的逐轮收敛。遗憾的是,为维护该自适应分布以进行梯度估计的每次迭代代价超过了计算完整梯度本身的代价,我们称之为鸡生蛋蛋生鸡循环。结果,迭代次数上更快收敛的假象实际上导致了时间上更慢的收敛。在本文中,我们打破了这一障碍,首次给出了一个方案——局部敏感哈希(LSH)采样随机梯度下降(LGD)的演示,该方案在将每次迭代的采样代价保持与均匀采样相近的同时,实现了更优的梯度估计。这样的算法之所以可能,得益于近期才明晰的LSH采样视角。作为更优且快速估计的结果,我们降低了所有依赖梯度估计的现有梯度下降算法的运行时间,包括Adam、Ada-grad等。我们通过线性模型以及非线性的BERT(一种近期流行的基于深度学习的语言表示模型)上的实验证明了我们方法的有效性。

关键词

引用

@article{arxiv.1910.14162,
  title  = {Lsh-sampling Breaks the Computation Chicken-and-egg Loop in Adaptive Stochastic Gradient Estimation},
  author = {Beidi Chen and Yingchen Xu and Anshumali Shrivastava},
  journal= {arXiv preprint arXiv:1910.14162},
  year   = {2019}
}