中文

基于可变性的多层感知机可训练性解释

机器学习 2023-05-19 v3

摘要

尽管深度神经网络(DNNs)在各种应用中取得了巨大成功,深度学习的许多基本方面仍未被完全理解,包括DNN的可训练性。在可训练性研究中,旨在辨别在可比条件下何种因素使一个DNN模型比另一个更易训练。特别地,我们的研究聚焦于具有相同参数量的多层感知机(MLP)模型。我们引入称为可变性的新概念,以帮助解释深度学习的好处以及训练极深MLP的困难。简言之,神经网络的可变性表示在数据空间中相对于良好缩放的随机权重所呈现的景观模式的丰富程度。我们通过经验表明,可变性与激活数量呈正相关,与一种称为“坍缩为常数”的现象呈负相关,该现象与相关但不等同于众所周知的梯度消失现象。在一个小型简化模型问题上的实验证实,可变性确实能准确预测MLP可训练性。此外,我们证明,作为MLP模型中的激活函数,绝对值函数可比流行的ReLU函数提供更好的可变性。

关键词

引用

@article{arxiv.2105.08911,
  title  = {Multi-layer Perceptron Trainability Explained via Variability},
  author = {Yueyao Yu and Yin Zhang},
  journal= {arXiv preprint arXiv:2105.08911},
  year   = {2023}
}