中文

隧道效应:在深度神经网络中构建数据表示

机器学习 2023-10-31 v2 计算机视觉与模式识别

摘要

深度神经网络因其在各类任务上的显著有效性而广为人知,共识是更深的网络隐式地学习更复杂的数据表示。本文表明,为监督式图像分类训练的足够深的网络会分裂为两个不同部分,对所得数据表示贡献不同。初始层创建线性可分表示,而后续层——我们称之为\textit{隧道}——压缩这些表示并对整体性能影响极小。我们通过全面的实证研究探究隧道的行为,强调它早在训练过程中就出现。其深度取决于网络容量与任务复杂度之间的关系。此外,我们展示隧道会降低分布外泛化能力,并讨论其对持续学习的启示。

关键词

引用

@article{arxiv.2305.19753,
  title  = {The Tunnel Effect: Building Data Representations in Deep Neural Networks},
  author = {Wojciech Masarczyk and Mateusz Ostaszewski and Ehsan Imani and Razvan Pascanu and Piotr Miłoś and Tomasz Trzciński},
  journal= {arXiv preprint arXiv:2305.19753},
  year   = {2023}
}

备注

NeurIPS 2023