无梯度训练神经网络:一种可扩展的ADMM方法
机器学习
2016-05-09 v1
摘要
随着大型网络模型与海量训练数据集日益重要,GPU已变得愈发必要用于训练神经网络。这主要是因为传统优化算法依赖随机梯度方法,而后者在集群环境中难以良好扩展到大量核心。此外,所有梯度方法(包括批方法)的收敛都受限于饱和效应、不良条件数以及鞍点等常见问题。本文探索了一种非常规训练方法,其使用交替方向方法与Bregman迭代来在无梯度下降步骤下训练网络。所提方法将网络训练问题化简为一系列最小化子步骤,其中每一步均可以封闭形式全局求解。该方法具有优势,因为它规避了使梯度方法在高度非凸问题上变慢的诸多隐患。该方法在分布式环境中表现出强扩展性,即便拆分到数千核心上也能产生线性加速。
引用
@article{arxiv.1605.02026,
title = {Training Neural Networks Without Gradients: A Scalable ADMM Approach},
author = {Gavin Taylor and Ryan Burmeister and Zheng Xu and Bharat Singh and Ankit Patel and Tom Goldstein},
journal= {arXiv preprint arXiv:1605.02026},
year = {2016}
}