中文

基于隐式微分的高维权重更新超参数可扩展一遍优化

机器学习 2022-04-22 v3 机器学习

摘要

机器学习训练方法大量且复杂地依赖于超参数,这催生了对其自动优化的策略。许多现有算法为每个新超参数选择重启训练,计算代价可观。一些基于超梯度的单遍方法已然存在,但它们要么无法应用于任意优化器超参数(如学习率和动量),要么训练耗时数倍于其基础模型。我们扩展这些现有方法,开发了一种基于近似超梯度的超参数优化器,适用于可微模型权重更新中出现的任意连续超参数,且仅需一次训练过程,无需重启。我们还提供了收敛至真实超梯度的启发性论证,并对每个模型参数独立学习率进行了可处理的基于梯度的优化。我们的方法在多个UCI数据集及Fashion-MNIST(使用一层MLP)、Penn Treebank(使用LSTM)和CIFAR-10(使用ResNet-18)上,从不同的随机超参数初始化出发均具竞争力,耗时仅比普通训练多2-3倍。

关键词

引用

@article{arxiv.2110.10461,
  title  = {Scalable One-Pass Optimisation of High-Dimensional Weight-Update Hyperparameters by Implicit Differentiation},
  author = {Ross M. Clarke and Elre T. Oldewage and José Miguel Hernández-Lobato},
  journal= {arXiv preprint arXiv:2110.10461},
  year   = {2022}
}

备注

41 pages, 19 figures, 15 tables; minor CIFAR-10 normalisation updates from ICLR 2022 camera-ready version