中文

深度神经网络中表征学习的训练动力学:架构与优化器的影响

机器学习 2025-02-04 v2

摘要

本文阐明了深度神经网络(DNN)中表征在训练过程中如何演化。我们的研究聚焦于参数充足的学习设置,即训练继续进行尽管已训练好的DNN已经对其训练数据进行完美拟合。在整个训练过程中,我们考察学习到的表征的演化。我们探索DNN各层在训练过程中相对各自表征的表示相似性。为此,我们使用两种相似性度量:(1)中心化核对齐(CKA)相似性;(2)基于线性分类器探针相似性。我们可视化并分析DNN输出及层探针在训练期间的决策区域,以展示它们如何几何演化。我们的大量实验发现,根据相对层深度、架构和优化器的不同,可能会在层中出现训练动力学模式。我们的主要发现包括:(i)训练阶段,包括与记忆相关的阶段,在SGD训练中比Adam训练更明显,对于ViT也比ResNet更明显;(ii)与ResNet不同,ViT层的表征学习动力学是同步的。

关键词

引用

@article{arxiv.2405.17377,
  title  = {How Do the Architecture and Optimizer Affect Representation Learning? On the Training Dynamics of Representations in Deep Neural Networks},
  author = {Yuval Sharon and Yehuda Dar},
  journal= {arXiv preprint arXiv:2405.17377},
  year   = {2025}
}