中文

基于新型双重指数移动平均的双向前瞻后顾式自适应与非自适应动量优化器

机器学习 2023-07-04 v1 最优化与控制

摘要

优化器是深度学习成功的关键组成部分,它根据训练集上的损失指导神经网络更新参数。SGD和Adam是两种经典且有效的优化器,研究者在其基础上提出了许多变体,如SGDM和RAdam。本文创新性地结合了优化器算法的后顾(backward-looking)与前瞻(forward-looking)两方面,提出了一种新颖的\textsc{Admeta}(\textbf{A} \textbf{D}ouble exponential \textbf{M}oving averag\textbf{E} \textbf{T}o \textbf{A}daptive and non-adaptive momentum,面向自适应与非自适应动量的双重指数移动平均)优化器框架。对于后顾部分,我们受股票市场某指标的启发,提出了一种DEMA变体方案,以替代常见的指数移动平均方案。而在前瞻部分,我们提出了一种动态lookahead策略,其渐近趋近于某一设定值,在初期保持速度、在末期保持高收敛性能。基于该思想,我们给出了两种优化器实现,\textsc{AdmetaR}和\textsc{AdmetaS},前者基于RAdam,后者基于SGDM。通过在多种任务上的大量实验,我们发现所提出的\textsc{Admeta}优化器优于我们的基础优化器,并较近期提出的竞争性优化器展现出优势。我们还提供了这两种算法的理论证明,验证了所提出\textsc{Admeta}的收敛性。

关键词

引用

@article{arxiv.2307.00631,
  title  = {Bidirectional Looking with A Novel Double Exponential Moving Average to Adaptive and Non-adaptive Momentum Optimizers},
  author = {Yineng Chen and Zuchao Li and Lefei Zhang and Bo Du and Hai Zhao},
  journal= {arXiv preprint arXiv:2307.00631},
  year   = {2023}
}