中文

残差网络中的深度方向超参数迁移:动态与缩放极限

机器学习 2023-12-11 v2 无序系统与神经网络 人工智能 机器学习

摘要

深度学习中超参数调优的成本随模型规模上升,促使实践者使用较小网络的代理来寻找新的调优方法。这样一种方案使用 μ\muP 参数化网络,其中小宽度网络的最优超参数可迁移到任意大宽度的网络。然而,在该方案中,超参数不能跨深度迁移。作为补救,我们研究了残差分支缩放为 1/depth1/\sqrt{\text{depth}} 并结合 μ\muP 参数化的残差网络。我们提供的实验表明,采用该参数化的残差架构(包括卷积ResNet与Vision Transformers)在CIFAR-10和ImageNet上展现出最优超参数跨宽度与深度的迁移。此外,我们的经验发现得到理论的支持与启发。利用神经网络学习动态的动力学平均场论(DMFT)描述的最新进展,我们表明ResNet的这种参数化容许一个定义良好的特征学习联合无限宽与无限深极限,并展示了有限规模网络动态向该极限的收敛。

关键词

引用

@article{arxiv.2309.16620,
  title  = {Depthwise Hyperparameter Transfer in Residual Networks: Dynamics and Scaling Limit},
  author = {Blake Bordelon and Lorenzo Noci and Mufan Bill Li and Boris Hanin and Cengiz Pehlevan},
  journal= {arXiv preprint arXiv:2309.16620},
  year   = {2023}
}