中文

深度前馈网络可证明稳定且一致训练的框架

机器学习 2023-05-23 v1 人工智能

摘要

我们提出了一种用于在有监督(分类与回归)和无监督(强化学习)场景下训练深度神经网络的新算法。该算法结合了标准随机梯度下降与梯度裁剪方法。输出层使用裁剪后的梯度进行更新,神经网络的其余部分使用标准梯度更新。使用裁剪梯度更新输出层可使其稳定。我们证明,只要神经网络仅由压缩(紧范围)激活函数组成,其余层便会自动稳定。我们还提出了一种新颖的压缩激活函数——它通过修改高斯误差线性单元(GELU)使其具有紧范围而得到——我们称之为截断 GELU(tGELU)。与 sigmoid 等其他压缩激活函数不同,tGELU 的范围可以显式指定。因此,由于范围小(例如 sigmoid 激活的情况)而产生的梯度消失问题得以消除。我们证明,由压缩激活函数(tGELU、sigmoid 等)组成的神经网络,在使用本文提出的算法更新时,数值稳定且性能一致(低方差)。该理论得到了大量实验的支持。在强化学习中,作为我们研究的一个结果,我们表明 Deep Q-Learning 中的目标网络可以省略,从而大大加快学习速度并缓解内存需求。基于交叉熵的分类算法在采用我们的框架训练时,其存在的高方差问题变得更加一致。训练中出现数值不稳定的一个症状是神经网络更新值的方差高。我们在理论和实验中均表明,我们的算法更新具有低方差,且训练损失以平滑方式下降。

关键词

引用

@article{arxiv.2305.12125,
  title  = {A Framework for Provably Stable and Consistent Training of Deep Feedforward Networks},
  author = {Arunselvan Ramaswamy and Shalabh Bhatnagar and Naman Saxena},
  journal= {arXiv preprint arXiv:2305.12125},
  year   = {2023}
}

备注

30 pages, 12 figures