中文

深度神经网络中非线性激活函数的全局吸引固定点的出现

机器学习 2024-10-30 v2 人工智能 机器学习

摘要

理解神经网络如何在各层之间转换输入数据对于解开其学习和泛化能力至关重要。尽管先前的工作利用核方法的见解来研究神经网络,对隐藏表示在各层之间的相似性如何演化进行全局分析仍未得到充分探索。在本文中,我们引入了一个核序列演化的理论框架,用于衡量两个不同输入在隐藏表示之间的相似性。在均值场范数下,我们展示了核序列通过仅取决于激活函数的核映射以确定性方式演化。通过对激活函数进行 Hermite 多项式展开并利用其代数性质,我们推导出核映射的显式形式并完全刻画其固定点。我们的分析揭示了对于非线性激活函数,核序列在全局上收敛于唯一的固定点,该固定点可以对应于正交或类似的表示,取决于激活函数和网络架构。我们进一步将结果扩展到具有残差连接和归一化层的网络,表明类似的收敛行为也存在。这一工作为深度神经网络的隐式偏好以及架构选择如何影响各层表示的演化提供了新的见解。

关键词

引用

@article{arxiv.2410.20107,
  title  = {Emergence of Globally Attracting Fixed Points in Deep Neural Networks With Nonlinear Activations},
  author = {Amir Joudaki and Thomas Hofmann},
  journal= {arXiv preprint arXiv:2410.20107},
  year   = {2024}
}