中文

ReLU人工神经网络训练中的归一化梯度流优化

最优化与控制 2022-07-14 v1 机器学习

摘要

人工神经网络(ANNs)的训练如今是一项高度相关的算法过程,在科学与工业中有诸多应用。粗略地说,ANNs可视为仿射线性函数与某些固定非线性函数之间的迭代复合,这些非线性函数通常是一维所谓激活函数的多维版本。此类一维激活函数最流行的选择是修正线性单元(ReLU)激活函数,其将实数映射到其正部 Rxmax{x,0}R\mathbb{R} \ni x \mapsto \max\{ x, 0 \} \in \mathbb{R}。在本文中,我们提出并分析了此类ReLU ANNs标准训练过程的一种修正变体,即我们提议将负梯度流动力学限制在ANN参数空间的一个大子流形上,该子流形是整个ANN参数空间的严格 CC^{\infty} 子流形,似乎比整个ANN参数空间具有更好的正则性质,但同时也足够大且足够高维,从而能够表示所有可通过整个ANN参数空间表示的ANN实现函数。在仅具有一维ANN层的浅层ANNs这一特殊情形下,我们还证明了对于每个Lipschitz连续目标函数,该ANN参数空间大子流形上的每条梯度流轨迹都是全局有界的。对于具有Lipschitz连续目标函数的整个ANN参数空间上的标准梯度流,证明或证伪梯度流轨迹的全局有界性即使在仅具有一维ANN层的浅层ANNs情形下仍是一个开放的研究问题。

关键词

引用

@article{arxiv.2207.06246,
  title  = {Normalized gradient flow optimization in the training of ReLU artificial neural networks},
  author = {Simon Eberle and Arnulf Jentzen and Adrian Riekert and Georg Weiss},
  journal= {arXiv preprint arXiv:2207.06246},
  year   = {2022}
}

备注

26 pages, 1 figure