中文

基于逐次凸近似的神经网络随机训练

机器学习 2017-06-16 v1 机器学习

摘要

本文提出一类新的神经网络训练算法。这些算法基于非凸优化领域的最新进展,统称为逐次凸近似(SCA)技术。其基本思想是迭代地将原始(非凸、高维)学习问题替换为一序列(强凸)近似问题,这些近似既精确又易于优化。与类似思路(例如拟牛顿算法)不同的是,这些近似可以仅利用神经网络函数的一阶信息,以随机方式构建,同时利用学习问题的整体结构以实现更快的收敛。我们讨论了若干用例,基于损失函数(如平方损失和交叉熵损失)以及神经网络权重正则化的不同选择。我们在多个中等规模的基准问题以及一个涉及模拟物理数据的大规模数据集上进行了实验。结果表明,该算法优于当前最先进的技术,能够更快收敛到更优的极小值。此外,我们还展示了该算法如何轻松地在多个计算单元上并行化而不影响其性能。特别地,每个计算单元可以优化一个定制的代理函数,该函数定义在随机分配的输入变量子集上,其维度可完全根据可用的计算能力来选择。

关键词

引用

@article{arxiv.1706.04769,
  title  = {Stochastic Training of Neural Networks via Successive Convex Approximations},
  author = {Simone Scardapane and Paolo Di Lorenzo},
  journal= {arXiv preprint arXiv:1706.04769},
  year   = {2017}
}

备注

Preprint submitted to IEEE Transactions on Neural Networks and Learning Systems