中文

MADA:通过超梯度下降的元自适应优化器

机器学习 2024-06-18 v3 最优化与控制

摘要

继 Adam 推出之后,多种用于深度学习的新型自适应优化器被提出。这些优化器通常在某些任务上表现出色,但可能无法在所有任务上一致地超越 Adam。本工作中,我们引入元自适应优化器(MADA),这是一个统一的优化器框架,能够泛化多种已知优化器,并在训练过程中动态学习最合适的一种。MADA 的核心思想是将优化器空间参数化,并在训练过程中利用超梯度下降动态搜索该空间。我们在视觉和语言任务上对 MADA 与其他流行优化器进行了实证比较,发现 MADA 一致地优于 Adam 及其他流行优化器,并且对次优调参的超参数具有鲁棒性。在 GPT-2 训练和微调期间,与其他流行优化器相比,MADA 在验证性能上相对于 Adam 取得了更大的提升。我们还提出了 AVGrad,这是 AMSGrad 的一种改进,用平均操作替代最大值操作,更适用于超梯度优化。最后,我们提供收敛性分析,表明优化器的参数化插值可以改善其误差界(至多相差常数),这暗示了元优化器的优势。

关键词

引用

@article{arxiv.2401.08893,
  title  = {MADA: Meta-Adaptive Optimizers through hyper-gradient Descent},
  author = {Kaan Ozkara and Can Karakus and Parameswaran Raman and Mingyi Hong and Shoham Sabach and Branislav Kveton and Volkan Cevher},
  journal= {arXiv preprint arXiv:2401.08893},
  year   = {2024}
}