中文

超参数缩放策略的元原则族

机器学习 2022-10-19 v2 高能物理 - 理论 机器学习

摘要

在本札记中,我们首先推导出一个单参数超参数缩放策略族,其在神经正切缩放下与平均场/最大更新缩放下插值。接着我们计算了宽且深神经网络中动力学可观测量——网络输出、神经正切核以及神经正切核的微分——的缩放。这些计算进而揭示了以宽度缩放深度的恰当方式,使得所得大规模模型保持其表示学习能力。最后我们观察到,文献中考察的各类无限宽极限对应于由有限宽神经网络有效理论所张开的互联网络的不同角落,其训练动力学从弱耦合到强耦合不等。

关键词

引用

@article{arxiv.2210.04909,
  title  = {Meta-Principled Family of Hyperparameter Scaling Strategies},
  author = {Sho Yaida},
  journal= {arXiv preprint arXiv:2210.04909},
  year   = {2022}
}

备注

24 pages; v2: an addendum added