中文

TUSLA 算法用于带 ReLU 激活函数神经网络的非凸学习的非渐近估计及其应用

最优化与控制 2023-05-03 v2 机器学习 数值分析 数值分析 概率论 机器学习

摘要

我们考虑目标函数具有超线性增长且不连续随机梯度的非凸随机优化问题。在此设定下,我们对 Lovas 等人(2020)提出的驯化未调整随机 Langevin 算法(TUSLA)给出非渐近分析。特别地,我们在 Wasserstein-1 与 Wasserstein-2 距离上建立了 TUSLA 算法的非渐近误差界。后一结果使我们能够进一步推导期望超额风险的非渐近估计。为说明主要结果的适用性,我们考虑了来自带 ReLU 神经网络的迁移学习的一个例子,其代表了机器学习中的关键范式。针对上述例子给出了支持我们理论发现的数值实验。因此,在此设定下,我们从理论与数值上证明了 TUSLA 算法能够求解涉及带 ReLU 激活函数神经网络的优化问题。此外,我们给出了合成例子的仿真结果,其中流行算法(如 ADAM、AMSGrad、RMSProp 与(朴素)随机梯度下降(SGD)算法)可能因相应随机梯度的超线性增长与不连续性而无法找到目标函数极小化子,而 TUSLA 算法快速收敛到最优解。而且,我们在真实世界数据集上提供了 TUSLA 与流行随机优化器的经验比较,并研究了 TUSLA 关键超参数对其性能的影响。

关键词

引用

@article{arxiv.2107.08649,
  title  = {Non-asymptotic estimates for TUSLA algorithm for non-convex learning with applications to neural networks with ReLU activation function},
  author = {Dong-Young Lim and Ariel Neufeld and Sotirios Sabanis and Ying Zhang},
  journal= {arXiv preprint arXiv:2107.08649},
  year   = {2023}
}