中文

在球面上训练尺度不变神经网络可能发生于三种机制

机器学习 2023-01-18 v3 机器学习

摘要

深度学习归一化技术(如批归一化)的一个基本属性是使归一化前参数具有尺度不变性。此类参数的内在域为单位球面,因此其梯度优化动态可通过具有变化有效学习率(ELR)的球面优化来表示,此前已有研究。然而,变化的 ELR 可能掩盖内在损失景观结构的某些特征。本工作中,我们研究使用固定 ELR 直接在球面上训练尺度不变神经网络的属性。我们根据 ELR 值发现此类训练的三种机制:收敛、混沌平衡与发散。我们在一个玩具示例的理论考察以及真实尺度不变深度学习模型的详尽实证分析中详细研究这些机制。每种机制具有独特特征并反映内在损失景观的特定属性,其中部分与先前关于常规及尺度不变神经网络训练的研究高度相似。最后,我们展示所发现的机制如何反映在归一化网络的常规训练中,以及如何利用它们获得更优极值。

关键词

引用

@article{arxiv.2209.03695,
  title  = {Training Scale-Invariant Neural Networks on the Sphere Can Happen in Three Regimes},
  author = {Maxim Kodryan and Ekaterina Lobacheva and Maksim Nakhodnov and Dmitry Vetrov},
  journal= {arXiv preprint arXiv:2209.03695},
  year   = {2023}
}

备注

Published in NeurIPS 2022. First three authors contributed equally