中文

一种基于差凸函数的神经网络参数优化全局收敛算法

机器学习 2024-01-17 v1 神经与进化计算 最优化与控制

摘要

我们提出了一种优化单隐藏层神经网络参数的算法。具体而言,我们推导了目标函数的分块差凸(DC)函数表示。基于此,我们提出了一种分块坐标下降(BCD)方法,并将其与定制的差凸函数算法(DCA)相结合。我们证明了所提算法的全局收敛性。此外,我们从数学上分析了参数的收敛速率和值的收敛速率(即训练损失)。我们给出了算法线性收敛甚至更快收敛的条件,这取决于损失函数的局部形状。我们通过数值实验证实了理论推导,并在训练损失和测试损失方面将我们的算法与最先进的基于梯度的求解器进行了比较。

关键词

引用

@article{arxiv.2401.07936,
  title  = {A Globally Convergent Algorithm for Neural Network Parameter Optimization Based on Difference-of-Convex Functions},
  author = {Daniel Tschernutter and Mathias Kraus and Stefan Feuerriegel},
  journal= {arXiv preprint arXiv:2401.07936},
  year   = {2024}
}

备注

accepted by TMLR