中文

神经网络优化轨迹的特征:方向性探索与冗余

机器学习 2024-06-25 v2 计算与语言 机器学习

摘要

我们通过分析优化轨迹丰富的方向性结构(由其逐点参数表示),提出了理解神经网络机制的新视角。为此,我们引入了一些关于优化轨迹复杂度的自然概念,包括定性和定量两方面,这些概念标志着神经网络中优化的方向性本质:何时存在冗余,何时存在探索。我们利用这些概念揭示了各种优化选择(如动量和权重衰减)之间固有的细微差别和相互作用。此外,轨迹视角帮助我们看到了规模对正则化轨迹方向性本质的影响,作为副产品,我们还观察到大语言模型(LLMs)中间注意力层中 Q、K、V 动态的有趣异质性,而这种异质性被规模所均质化。重要的是,我们将观察到的显著方向性冗余付诸测试,证明在训练进行一段时间后仅训练标量 batchnorm 参数即可匹配训练整个网络的性能,从而展示了面向效率的混合优化方案的潜力。

关键词

引用

@article{arxiv.2403.07379,
  title  = {Hallmarks of Optimization Trajectories in Neural Networks: Directional Exploration and Redundancy},
  author = {Sidak Pal Singh and Bobby He and Thomas Hofmann and Bernhard Schölkopf},
  journal= {arXiv preprint arXiv:2403.07379},
  year   = {2024}
}

备注

Preprint, 57 pages