中文

特征学习的高维渐近:单步梯度如何改善表示

机器学习 2022-05-04 v1 机器学习 统计理论 统计理论

摘要

我们研究两层神经网络中第一层参数 W\boldsymbol{W} 的首个梯度下降步:f(x)=1Naσ(Wx)f(\boldsymbol{x}) = \frac{1}{\sqrt{N}}\boldsymbol{a}^\top\sigma(\boldsymbol{W}^\top\boldsymbol{x}),其中 WRd×N,aRN\boldsymbol{W}\in\mathbb{R}^{d\times N}, \boldsymbol{a}\in\mathbb{R}^{N} 被随机初始化,训练目标为经验 MSE 损失:1ni=1n(f(xi)yi)2\frac{1}{n}\sum_{i=1}^n (f(\boldsymbol{x}_i)-y_i)^2。在 n,d,Nn,d,N\to\infty 以相同速率增长的比例渐近极限下,以及一个理想化的师生设定中,我们证明首个梯度更新包含一个秩为 1 的“尖峰”,其导致第一层权重与教师模型 ff^* 的线性分量之间的对齐。为刻画该对齐的影响,当 ff^* 为单指标模型时,我们计算了在 W\boldsymbol{W} 上以学习率 η\eta 执行一步梯度后,基于共轭核的岭回归的预测风险。我们考虑首步学习率 η\eta 的两种缩放。对于小的 η\eta,我们建立了训练特征映射的高斯等价性质,并证明所学核优于初始随机特征模型,但无法击败输入上的最佳线性模型。而对于足够大的 η\eta,我们证明对于某些 ff^*,在训练特征上的同一岭估计器可以超越该“线性 regime”并优于广泛的随机特征与旋转不变核。我们的结果表明,即使单步梯度也能带来相对于随机特征的显著优势,并凸显了训练初始阶段中学习率缩放的作用。

关键词

引用

@article{arxiv.2205.01445,
  title  = {High-dimensional Asymptotics of Feature Learning: How One Gradient Step Improves the Representation},
  author = {Jimmy Ba and Murat A. Erdogdu and Taiji Suzuki and Zhichao Wang and Denny Wu and Greg Yang},
  journal= {arXiv preprint arXiv:2205.01445},
  year   = {2022}
}

备注

71 pages