中文

论神经网络函数的高对称性

机器学习 2022-11-15 v1

摘要

训练神经网络意味着求解一个高维优化问题。通常的目标是最小化一个依赖于所谓网络函数(换言之,给定某一输入给出网络输出的函数)的损失函数。该函数依赖于大量参数(也称为权重),这些参数取决于网络架构。一般而言,该优化问题的目标是找到网络函数的全局最小值。本文讨论了由于神经网络的设计方式,神经网络函数在参数空间中呈现出非常大的对称性。本工作表明,神经网络函数具有大量等价极小值——即给出相同损失函数值和完全相同输出的极小值——其数量对于前馈神经网络随每层神经元数量、对于卷积神经网络随滤波器数量呈阶乘增长。当神经元和层数很大时,等价极小值的数量增长极快。这当然会对研究训练过程中神经网络如何收敛到极小值产生影响。这一结果是已知的,但本文首次给出了恰当的数学讨论并推导了等价极小值数量的估计。

关键词

引用

@article{arxiv.2211.06603,
  title  = {On the High Symmetry of Neural Network Functions},
  author = {Umberto Michelucci},
  journal= {arXiv preprint arXiv:2211.06603},
  year   = {2022}
}