中文

过参数化线性模型中的主成分偏差及其在深度神经网络中的表现

机器学习 2023-12-29 v8

摘要

近期研究表明,不同架构的卷积神经网络以相同的顺序学习图像分类。为理解这一现象,我们重新审视过参数化深度线性网络模型。我们的分析揭示,当隐藏层足够宽时,该模型参数沿数据较大主成分方向的收敛速度呈指数级加快,其速率由相应的奇异值决定。我们将这种收敛模式称为主成分偏差(PC-bias)。通过实验,我们展示了 PC-bias 如何理顺线性和非线性网络的学习顺序,且在学习的较早阶段更为显著。随后我们将结果与简单性偏差进行比较,表明两种偏差可独立出现,并以不同方式影响学习顺序。最后,我们讨论了 PC-bias 如何解释早停的某些益处及其与 PCA 的联系,以及为何深度网络在随机标签下收敛更慢。

关键词

引用

@article{arxiv.2105.05553,
  title  = {Principal Components Bias in Over-parameterized Linear Models, and its Manifestation in Deep Neural Networks},
  author = {Guy Hacohen and Daphna Weinshall},
  journal= {arXiv preprint arXiv:2105.05553},
  year   = {2023}
}

备注

JMLR 2022