特征速度公式:一种灵活缩放深度神经网络超参数的方法
机器学习
2025-07-29 v4
摘要
深度学习的成功源于分层特征学习,然而初始化尺度、学习率等超参数(HP)的调优仅能间接控制该行为。本文引入一个预测和控制特征学习的关键概念:特征更新与反向传播(在层索引 处)之间的夹角 。我们证明,在任意训练时刻,一次梯度下降步后的特征更新幅度可通过一个简单且通用的\emph{特征速度公式},由该夹角 、损失衰减以及反向传播幅度表示。该夹角 由层间雅可比矩阵的条件数控制,在随机初始化时由某一核的谱决定,当 时该核与神经正切核一致。给定 ,特征速度公式为我们提供了调整 HP(尺度和学习率)以满足特定动力学性质(如特征学习与损失衰减)的规则。我们研究了该方法在宽度后深度极限下对 ReLU MLP 和 ResNet 的启示。基于已有工作,我们证明在 iid 初始化的 ReLU MLP 中,夹角随深度退化如 。相比之下,分支尺度为 的 ResNet 保持非退化夹角 。我们利用这些见解恢复了已知 HP 缩放的关键性质,并引入了一种具有良好理论性质的大深度 ReLU MLP 新 HP 缩放。
引用
@article{arxiv.2311.18718,
title = {The Feature Speed Formula: a flexible approach to scale hyper-parameters of deep neural networks},
author = {Lénaïc Chizat and Praneeth Netrapalli},
journal= {arXiv preprint arXiv:2311.18718},
year = {2025}
}
备注
Previous title "Steering deep feature learning with backward aligned feature updates". This is the published version. Novelties compared to v1: BFA for linear Resnets (Prop. 5.2), scaling FSC (Table 1), and content reorganized