中文

无梯度训练神经网络:一种可扩展的ADMM方法

机器学习 2016-05-09 v1

摘要

随着大型网络模型与海量训练数据集日益重要,GPU已变得愈发必要用于训练神经网络。这主要是因为传统优化算法依赖随机梯度方法,而后者在集群环境中难以良好扩展到大量核心。此外,所有梯度方法(包括批方法)的收敛都受限于饱和效应、不良条件数以及鞍点等常见问题。本文探索了一种非常规训练方法,其使用交替方向方法与Bregman迭代来在无梯度下降步骤下训练网络。所提方法将网络训练问题化简为一系列最小化子步骤,其中每一步均可以封闭形式全局求解。该方法具有优势,因为它规避了使梯度方法在高度非凸问题上变慢的诸多隐患。该方法在分布式环境中表现出强扩展性,即便拆分到数千核心上也能产生线性加速。

关键词

引用

@article{arxiv.1605.02026,
  title  = {Training Neural Networks Without Gradients: A Scalable ADMM Approach},
  author = {Gavin Taylor and Ryan Burmeister and Zheng Xu and Bharat Singh and Ankit Patel and Tom Goldstein},
  journal= {arXiv preprint arXiv:1605.02026},
  year   = {2016}
}