中文

读懂符号:迈向对梯度下降超参数初始化的不变性

机器学习 2023-01-25 v1

摘要

我们提出 ActiveLR,一种优化元算法,它局部化学习率 α\alpha,并根据每轮梯度是否改变符号在每轮自适应调整。这种具有符号意识的算法能察觉从上一步到当前步每个参数的更新是过大还是过小,并相应调整 α\alpha。我们实现了广泛使用的及近期发表的梯度下降优化器的 Active 版本(我们的),即带动量的 SGD、AdamW、RAdam 和 AdaBelief。我们在 ImageNet、CIFAR-10、WikiText-103、WikiText-2 和 PASCAL VOC 上使用不同模型架构(如 ResNet 和 Transformers)的实验表明,所测试优化器的 Active 变体在泛化性和训练集拟合上有所提升,且训练时间减少。结果还显示这些优化器的 Active 变体对不同初始学习率值具有鲁棒性。此外,使用大 mini-batch 尺寸的不良影响得到缓解。因此,ActiveLR 减轻了对两个最常调优、且需耗费大量时间与计算成本来选取的超参数的搜索需求。我们鼓励 AI 研究人员与从业者使用其优选优化器的 Active 变体,以加快训练、提升泛化性,并减少训练深度神经网络的碳足迹。

关键词

引用

@article{arxiv.2301.10133,
  title  = {Read the Signs: Towards Invariance to Gradient Descent's Hyperparameter Initialization},
  author = {Davood Wadi and Marc Fredette and Sylvain Senecal},
  journal= {arXiv preprint arXiv:2301.10133},
  year   = {2023}
}

备注

7 pages, 7 figures