中文

神经网络中最优常数解的早期学习

机器学习 2024-06-26 v1

摘要

深度神经网络在训练过程中逐渐学习越来越复杂的函数。我们在此表明,通过实验和理论分析发现,目标函数的学习在网络学习最优常数解(OCS)的早期阶段preceded。即,初始模型响应镜像目标标签的分布,而完全忽略输入中提供的信息。我们采用分层类别学习任务,推导了在带偏置项的深线性网络中学习动力学的精确解。即使初始化为零,这种简单的架构特征仍会在早期动力学中引起显著变化。我们识别了这种早期OCS阶段的特征,并说明这些特征在深线性网络以及基于 MNIST 和 CIFAR10 的更大、更复杂(且非线性)卷积神经网络解决分层学习任务时均可被观察到。我们通过证明深线性网络必然在早期学习中学习OCS来解释这些观察结果。为进一步探讨这些结果的普适性,我们在基于类别学习任务的三个星期内训练人类学习者。随后,我们以真阳性(正确拒绝)率动力学的质性特征识别这种早期OCS阶段的迹象。令人惊讶地发现,人类学习者的行为中同样存在早期依赖OCS的现象。最后,我们表明,即使在没有偏置项的情况下,OCS的学习也会出现,并且同样是由输入数据的通用相关性所驱动。总体而言,本工作表明OCS是监督、纠错式学习中的通用学习原则,以及其流行性的机制性原因。

关键词

引用

@article{arxiv.2406.17467,
  title  = {Early learning of the optimal constant solution in neural networks and humans},
  author = {Jirko Rubruck and Jan P. Bauer and Andrew Saxe and Christopher Summerfield},
  journal= {arXiv preprint arXiv:2406.17467},
  year   = {2024}
}