中文

深度学习中块坐标下降的全局收敛性

最优化与控制 2019-05-14 v4 机器学习 机器学习

摘要

深度学习因其巨大的实证成功引起了广泛关注。块坐标下降(BCD)方法在深度神经网络(DNN)训练中的高效性近来已得到证实。然而,由于 DNN 训练的高度非凸性质,关于其收敛性的理论研究十分有限。本文旨在为该类方法提供可证明收敛保证的通用方法论。具体而言,对于大多数涉及二分裂和三分裂方案的常用 DNN 训练模型,我们建立了以 O(1/k){\cal O}(1/k) 的速率全局收敛到临界点的结果,其中 kk 为迭代次数。该结果可推广到具有 Lipschitz 连续梯度的通用损失函数以及深度残差网络(ResNets)。我们的关键进展为 Kurdyka-{\L}ojasiewicz 不等式框架增添了几项新要素,使我们能够在深度学习的通用场景下对 BCD 进行全局收敛分析。

关键词

引用

@article{arxiv.1803.00225,
  title  = {Global Convergence of Block Coordinate Descent in Deep Learning},
  author = {Jinshan Zeng and Tim Tsz-Kit Lau and Shaobo Lin and Yuan Yao},
  journal= {arXiv preprint arXiv:1803.00225},
  year   = {2019}
}

备注

27 pages, 2 figures