中文

特征速度公式:一种灵活缩放深度神经网络超参数的方法

机器学习 2025-07-29 v4

摘要

深度学习的成功源于分层特征学习,然而初始化尺度、学习率等超参数(HP)的调优仅能间接控制该行为。本文引入一个预测和控制特征学习的关键概念:特征更新与反向传播(在层索引 \ell 处)之间的夹角 θ\theta_\ell。我们证明,在任意训练时刻,一次梯度下降步后的特征更新幅度可通过一个简单且通用的\emph{特征速度公式},由该夹角 θ\theta_\ell、损失衰减以及反向传播幅度表示。该夹角 θ\theta_\ell 由层间雅可比矩阵的条件数控制,在随机初始化时由某一核的谱决定,当 =depth\ell=\text{depth} 时该核与神经正切核一致。给定 θ\theta_\ell,特征速度公式为我们提供了调整 HP(尺度和学习率)以满足特定动力学性质(如特征学习与损失衰减)的规则。我们研究了该方法在宽度后深度极限下对 ReLU MLP 和 ResNet 的启示。基于已有工作,我们证明在 iid 初始化的 ReLU MLP 中,夹角随深度退化如 cos(θ)=Θ(1/)\cos(\theta_\ell)=\Theta(1/\sqrt{\ell})。相比之下,分支尺度为 O(1/depth)O(1/\sqrt{\text{depth}}) 的 ResNet 保持非退化夹角 cos(θ)=Θ(1)\cos(\theta_\ell)=\Theta(1)。我们利用这些见解恢复了已知 HP 缩放的关键性质,并引入了一种具有良好理论性质的大深度 ReLU MLP 新 HP 缩放。

关键词

引用

@article{arxiv.2311.18718,
  title  = {The Feature Speed Formula: a flexible approach to scale hyper-parameters of deep neural networks},
  author = {Lénaïc Chizat and Praneeth Netrapalli},
  journal= {arXiv preprint arXiv:2311.18718},
  year   = {2025}
}

备注

Previous title "Steering deep feature learning with backward aligned feature updates". This is the published version. Novelties compared to v1: BFA for linear Resnets (Prop. 5.2), scaling FSC (Table 1), and content reorganized