初始化在深度线性网络隐式偏差中的作用
机器学习
2024-02-06 v1 数值分析
数值分析
摘要
尽管深度学习(DL)在经验上取得了成功,但我们对其实效的理论理解仍然有限。一个显著的悖论是,传统经验不鼓励完美拟合数据,而深度神经网络正是为此设计的,但它们却能有效地泛化。本研究重点探讨这一现象,其归因于隐式偏差的作用。人们已经确定了多种隐式偏差的来源,如步长、权重初始化、优化算法和参数数量。在这项工作中,我们专注于研究源于权重初始化的隐式偏差。为此,我们考察了在不同背景下求解欠定线性系统的问题,仔细分析了使用深度网络求解此类系统时初始化对隐式正则化的影响。我们的发现阐明了初始化在优化和泛化悖论中的作用,有助于更全面地理解 DL 的性能特征。
引用
@article{arxiv.2402.02454,
title = {On the Role of Initialization on the Implicit Bias in Deep Linear Networks},
author = {Oria Gruber and Haim Avron},
journal= {arXiv preprint arXiv:2402.02454},
year = {2024}
}