深度学习中块坐标下降的全局收敛性
最优化与控制
2019-05-14 v4 机器学习
机器学习
摘要
深度学习因其巨大的实证成功引起了广泛关注。块坐标下降(BCD)方法在深度神经网络(DNN)训练中的高效性近来已得到证实。然而,由于 DNN 训练的高度非凸性质,关于其收敛性的理论研究十分有限。本文旨在为该类方法提供可证明收敛保证的通用方法论。具体而言,对于大多数涉及二分裂和三分裂方案的常用 DNN 训练模型,我们建立了以 的速率全局收敛到临界点的结果,其中 为迭代次数。该结果可推广到具有 Lipschitz 连续梯度的通用损失函数以及深度残差网络(ResNets)。我们的关键进展为 Kurdyka-{\L}ojasiewicz 不等式框架增添了几项新要素,使我们能够在深度学习的通用场景下对 BCD 进行全局收敛分析。
引用
@article{arxiv.1803.00225,
title = {Global Convergence of Block Coordinate Descent in Deep Learning},
author = {Jinshan Zeng and Tim Tsz-Kit Lau and Shaobo Lin and Yuan Yao},
journal= {arXiv preprint arXiv:1803.00225},
year = {2019}
}
备注
27 pages, 2 figures