趋向无限宽度的二阶优化参数化研究
机器学习
2024-06-11 v2
摘要
二阶优化旨在加速深度神经网络的训练,并正被应用于日益大规模的模型。在本研究中,面向更大规模的训练,我们确定了一种特定的二阶优化参数化方法,该方法即使在网络宽度显著增加的情况下,也能以稳定的方式促进特征学习。受最大更新参数化的启发,我们考虑了梯度的一步更新,并揭示了包括随机初始化、学习率和阻尼项在内的超参数的适当尺度。我们的方法涵盖了 K-FAC 和 Shampoo 这两种主要的二阶优化算法,并证明我们的参数化在特征学习中实现了更高的泛化性能。特别是,它使我们能够在不同宽度的模型间迁移超参数。
引用
@article{arxiv.2312.12226,
title = {On the Parameterization of Second-Order Optimization Effective Towards the Infinite Width},
author = {Satoki Ishikawa and Ryo Karakida},
journal= {arXiv preprint arXiv:2312.12226},
year = {2024}
}
备注
34 pages, ICLR 2024