中文

面向一般 $C^1$ 函数的回溯梯度下降法及其在深度学习中的应用

最优化与控制 2021-03-02 v2 机器学习 数值分析 数值分析 机器学习

摘要

标准梯度下降是一种非常流行的优化方法,但其收敛性仅能在梯度全局 Lipschitz 连续的函数的范畴内得证。因此,它实际上并不适用于深度神经网络等现实应用。本文证明其后回溯变体表现良好,特别地,可对全部 Morse 函数证明收敛性。本文的主要理论结果如下。定理:设 f:RkRf:\mathbb{R}^k\rightarrow \mathbb{R}C1C^1 函数,{zn}\{z_n\} 为由回溯梯度下降算法构造的序列。(1) 要么 limnzn=\lim _{n\rightarrow\infty}||z_n||=\infty,要么 limnzn+1zn=0\lim _{n\rightarrow\infty}||z_{n+1}-z_n||=0。(2) 假设 ff 至多含可数个临界点。则要么 limnzn=\lim _{n\rightarrow\infty}||z_n||=\infty,要么 {zn}\{z_n\} 收敛至 ff 的一个临界点。(3) 更一般地,假设 ff 的临界点集的所有连通分支均紧。则要么 limnzn=\lim _{n\rightarrow\infty}||z_n||=\infty,要么 {zn}\{z_n\} 有界。且在后一种情形中,{zn}\{z_n\} 的聚点集连通。本文包含了该结果的一些推广版本,含不精确版本。另一结果涉及鞍点问题。我们随后给出启发式论证以解释标准梯度下降法为何表现如此良好,并给出 GD、MMT 与 NAG 回溯版本的改进。在 CIFAR10 与 CIFAR100 数据集上基于多种流行架构的实验,验证了该启发式论证在 mini-batch 实践中的成立,并表明我们的新算法在自动微调学习率的同时,优于 MMT、NAG、Adagrad、Adadelta、RMSProp、Adam 与 Adamax 等当前最优方法。

关键词

引用

@article{arxiv.1808.05160,
  title  = {Backtracking gradient descent method for general $C^1$ functions, with applications to Deep Learning},
  author = {Tuyen Trung Truong and Tuan Hang Nguyen},
  journal= {arXiv preprint arXiv:1808.05160},
  year   = {2021}
}

备注

37 pages, 3 figures, 3 tables. Exposition improved, many new results are added. Accompanying source codes will be available at the link: https://github.com/hank-nguyen/MBT-optimizer