中文

训练感知型 Sigmoid 优化器

机器学习 2021-02-18 v1

摘要

深度神经网络的恰当优化是一个开放的研究问题,因为贯穿训练过程改变学习率的最优流程仍未知。手动定义学习率调度涉及繁琐耗时的试错过程,以确定诸如学习率衰减轮次和学习率衰减率等超参数。尽管自适应学习率优化器使该过程自动化,近期研究表明与精细调节的学习率调度相比,它们可能产生过拟合并降低性能。考虑到深度神经网络损失函数的景观中鞍点远多于局部极小,我们提出了训练感知型 Sigmoid 优化器(TASO),其由两阶段自动化学习率调度组成。第一阶段使用高学习率快速穿越众多鞍点,而第二阶段使用低学习率缓慢逼近先前找到的局部极小中心。我们将所提方法与 Adam、RMSProp 和 Adagrad 等常用自适应学习率调度进行比较。我们的实验表明,TASO 在最优(即执行超参数验证)和次优(即使用默认超参数)场景下均优于所有竞争方法。

关键词

引用

@article{arxiv.2102.08716,
  title  = {Training Aware Sigmoidal Optimizer},
  author = {David Macêdo and Pedro Dreyer and Teresa Ludermir and Cleber Zanchettin},
  journal= {arXiv preprint arXiv:2102.08716},
  year   = {2021}
}