中文

一种用于深度学习的通用随机近端梯度方法族

机器学习 2020-07-16 v1 最优化与控制 机器学习

摘要

我们研究带正则化神经网络的训练问题,其中正则化项可以是非光滑且非凸的。我们提出了一个随机近端梯度下降的统一框架,称之为 ProxGen,它允许任意正预条件子与下半连续正则化项。我们的框架将不带预条件子的标准随机近端梯度方法作为特例涵盖在内,这类方法已在多种设定下被广泛研究。不仅如此,作为我们方法的副产品,我们给出了超越已知标准方法的两个重要更新规则:(i) 自适应随机梯度方法下 q\ell_q 正则化(0q10 \leq q \leq 1)的首个闭式近端映射,以及 (ii) 修正版的 ProxQuant,它修复了原始方法在量化特定正则化项上的一个缺陷。我们分析了 ProxGen 的收敛性,并证明整个 ProxGen 族享有与不带预条件子的随机近端梯度下降相同的收敛速率。我们还通过大量实验从经验上展示了近端方法相对于基于次梯度方法的优越性。有趣的是,我们的结果表明,采用非凸正则化项的近端方法比采用凸正则化项的更为有效。

关键词

引用

@article{arxiv.2007.07484,
  title  = {A General Family of Stochastic Proximal Gradient Methods for Deep Learning},
  author = {Jihun Yun and Aurelie C. Lozano and Eunho Yang},
  journal= {arXiv preprint arXiv:2007.07484},
  year   = {2020}
}

备注

21 pages