中文

面向理论启发的神经网络初始化优化

机器学习 2022-10-13 v1 计算机视觉与模式识别

摘要

自动化机器学习已被广泛研究以减少人工设计神经架构与寻找合适超参数的负担。然而,在神经初始化领域,类似的自动化技术很少被探讨。大多数现有初始化方法是手工设计且高度依赖于特定架构。本文提出一种具理论洞见的名为 GradCosine 的可微度量,用于评估神经网络的初始状态。具体而言,GradCosine 是样本级梯度相对于初始化参数的余弦相似度。通过分析样本级优化景观,我们表明在梯度范数约束下最大化 GradCosine 可提升网络的训练与测试性能。基于该观察,我们进一步提出神经初始化优化(NIO)算法。由样本级分析推广至真实批量设置,NIO 能以相比训练时间可忽略的代价自动寻找更好的初始化。借助 NIO,我们提升了多种神经架构在 CIFAR-10、CIFAR-100 和 ImageNet 上的分类性能。此外,我们发现该方法甚至有助于无需 warmup 训练大型视觉 Transformer 架构。

关键词

引用

@article{arxiv.2210.05956,
  title  = {Towards Theoretically Inspired Neural Initialization Optimization},
  author = {Yibo Yang and Hong Wang and Haobo Yuan and Zhouchen Lin},
  journal= {arXiv preprint arXiv:2210.05956},
  year   = {2022}
}

备注

NeurIPS 2022