神经网络景观的超一致性与学习率迁移
机器学习
2024-11-14 v2
摘要
最近,越来越多的证据表明,如果神经网络的宽度和深度向所谓的丰富特征学习极限 (P 及其深度扩展) 缩放,那么某些超参数(如学习率)会表现出从小模型到超大模型的迁移性。从优化角度来看,这种现象令人困惑,因为它意味着损失景观在不同模型尺寸之间保持一致的相似性。在本工作中,我们通过损失 Hessian 矩阵的视角研究该景观,重点关注其最大特征值(即锐度),发现 P 下的某些谱特性在很大程度上独立于网络规模,并随着训练的进行保持一致。我们将这一特性命名为景观的超一致性 (Super Consistency)。另一方面,我们表明在神经正交核 (NTK) 和其他缩放机制下,锐度在不同尺度上表现出截然不同的动力学。那么,是什么导致了这些锐度动力学的差异?通过 Hessian 谱与 NTK 谱之间的联系,我们认为原因在于特征学习的存在(对于 P)或逐渐缺失(对于 NTK 缩放)。我们通过一套广泛的实验证实了我们的主张,涵盖了各种数据集和架构:从在基准视觉数据集上训练的 ResNets 和 Vision Transformers,到在 WikiText 上训练的基于 Transformer 的语言模型。
引用
@article{arxiv.2402.17457,
title = {Super Consistency of Neural Network Landscapes and Learning Rate Transfer},
author = {Lorenzo Noci and Alexandru Meterez and Thomas Hofmann and Antonio Orvieto},
journal= {arXiv preprint arXiv:2402.17457},
year = {2024}
}
备注
The paper has been accepted at Neurips 2024. This is a revised version of the paper previously titled "Why do Learning Rates Transfer? Reconciling Optimization and Scaling Limits for Deep Learning"