面向一般 $C^1$ 函数的回溯梯度下降法及其在深度学习中的应用
最优化与控制
2021-03-02 v2 机器学习
数值分析
数值分析
机器学习
摘要
标准梯度下降是一种非常流行的优化方法,但其收敛性仅能在梯度全局 Lipschitz 连续的函数的范畴内得证。因此,它实际上并不适用于深度神经网络等现实应用。本文证明其后回溯变体表现良好,特别地,可对全部 Morse 函数证明收敛性。本文的主要理论结果如下。定理:设 为 函数, 为由回溯梯度下降算法构造的序列。(1) 要么 ,要么 。(2) 假设 至多含可数个临界点。则要么 ,要么 收敛至 的一个临界点。(3) 更一般地,假设 的临界点集的所有连通分支均紧。则要么 ,要么 有界。且在后一种情形中, 的聚点集连通。本文包含了该结果的一些推广版本,含不精确版本。另一结果涉及鞍点问题。我们随后给出启发式论证以解释标准梯度下降法为何表现如此良好,并给出 GD、MMT 与 NAG 回溯版本的改进。在 CIFAR10 与 CIFAR100 数据集上基于多种流行架构的实验,验证了该启发式论证在 mini-batch 实践中的成立,并表明我们的新算法在自动微调学习率的同时,优于 MMT、NAG、Adagrad、Adadelta、RMSProp、Adam 与 Adamax 等当前最优方法。
引用
@article{arxiv.1808.05160,
title = {Backtracking gradient descent method for general $C^1$ functions, with applications to Deep Learning},
author = {Tuyen Trung Truong and Tuan Hang Nguyen},
journal= {arXiv preprint arXiv:1808.05160},
year = {2021}
}
备注
37 pages, 3 figures, 3 tables. Exposition improved, many new results are added. Accompanying source codes will be available at the link: https://github.com/hank-nguyen/MBT-optimizer