MetaGrad:在线学习中利用多学习率的自适应方法
机器学习
2021-08-31 v2 机器学习
摘要
我们提出一种用于在线凸优化的新自适应方法 MetaGrad,该方法对一般凸损失具有鲁棒性,但对广泛一类特殊函数实现更快的速率,包括指数凹和强凸函数,以及各类无任何曲率的随机和非随机函数。我们通过建立与 Bernstein 条件的联系来证明这一点,已知该条件在离线统计学习中蕴含快速速率。MetaGrad 进一步自动适应梯度的大小。其主要特征是同时考虑多个学习率,这些学习率使用一种新的元算法按其在数据上的经验性能直接成比例加权。我们提供三个版本的 MetaGrad。全矩阵版本维护一个完整协方差矩阵,适用于更新时间维度平方可承受的学习任务。另外两个版本针对高维学习任务提供加速,更新时间随维度线性:一个基于草图,另一个基于对每个坐标运行基本算法的独立副本。我们在基准在线分类和回归任务上评估所有版本的 MetaGrad,它们一致优于在线梯度下降和 AdaGrad。
引用
@article{arxiv.2102.06622,
title = {MetaGrad: Adaptation using Multiple Learning Rates in Online Learning},
author = {Tim van Erven and Wouter M. Koolen and Dirk van der Hoeven},
journal= {arXiv preprint arXiv:2102.06622},
year = {2021}
}