中文

DANTE:用于训练神经网络的深度交替法

机器学习 2020-08-11 v3 机器学习

摘要

我们提出 DANTE,一种利用交替最小化原理训练神经网络的新方法。DANTE 为传统上常用于训练深度网络的基于梯度的反向传播技术提供了另一种视角。它利用拟凸性的一种适配,将神经网络训练构建为一个双拟凸优化问题。我们表明,对于具有可微(如 sigmoid)和不可微(如 ReLU)激活函数的神经网络配置,我们可以在该公式中有效地执行交替。DANTE 也可扩展至具有多个隐藏层的网络。在标准数据集上的实验中,使用所提方法训练的神经网络在解的质量以及训练速度方面均表现出前景,并与传统反向传播技术具有竞争力。

关键词

引用

@article{arxiv.1902.00491,
  title  = {DANTE: Deep AlterNations for Training nEural networks},
  author = {Vaibhav B Sinha and Sneha Kudugunta and Adepu Ravi Sankar and Surya Teja Chavali and Purushottam Kar and Vineeth N Balasubramanian},
  journal= {arXiv preprint arXiv:1902.00491},
  year   = {2020}
}

备注

19 pages