ReLU人工神经网络训练中的归一化梯度流优化
最优化与控制
2022-07-14 v1 机器学习
摘要
人工神经网络(ANNs)的训练如今是一项高度相关的算法过程,在科学与工业中有诸多应用。粗略地说,ANNs可视为仿射线性函数与某些固定非线性函数之间的迭代复合,这些非线性函数通常是一维所谓激活函数的多维版本。此类一维激活函数最流行的选择是修正线性单元(ReLU)激活函数,其将实数映射到其正部 。在本文中,我们提出并分析了此类ReLU ANNs标准训练过程的一种修正变体,即我们提议将负梯度流动力学限制在ANN参数空间的一个大子流形上,该子流形是整个ANN参数空间的严格 子流形,似乎比整个ANN参数空间具有更好的正则性质,但同时也足够大且足够高维,从而能够表示所有可通过整个ANN参数空间表示的ANN实现函数。在仅具有一维ANN层的浅层ANNs这一特殊情形下,我们还证明了对于每个Lipschitz连续目标函数,该ANN参数空间大子流形上的每条梯度流轨迹都是全局有界的。对于具有Lipschitz连续目标函数的整个ANN参数空间上的标准梯度流,证明或证伪梯度流轨迹的全局有界性即使在仅具有一维ANN层的浅层ANNs情形下仍是一个开放的研究问题。
引用
@article{arxiv.2207.06246,
title = {Normalized gradient flow optimization in the training of ReLU artificial neural networks},
author = {Simon Eberle and Arnulf Jentzen and Adrian Riekert and Georg Weiss},
journal= {arXiv preprint arXiv:2207.06246},
year = {2022}
}
备注
26 pages, 1 figure