中文

MetaGrad:在线学习中的多学习率

机器学习 2021-08-31 v3

摘要

在在线凸优化中,众所周知某些目标函数的子类比任意凸函数容易得多。我们致力于设计自适应方法,能够在尽可能多的此类子类中自动获得快速收敛速率,而无需任何手动调参。以往的自适应方法能够在强凸和一般凸函数之间插值。我们提出一种新方法 MetaGrad,它适应于更广泛的函数类,包括指数凹和强凸函数,以及各类无任何曲率的随机和非随机函数。例如,如果数据来自有利的概率分布,即使无正则化的铰链损失(hinge loss)没有曲率,MetaGrad 也能在其上实现对数遗憾(logarithmic regret)。MetaGrad 的主要特征是同时考虑多个学习率。然而,与之前具有可证明遗憾保证的方法不同,其学习率不随时间单调递减,也不基于理论上推导的遗憾界进行调参。相反,它们通过使用倾斜指数权重主算法(tilted exponential weights master algorithm)按其在数据上的经验性能直接成比例加权。

关键词

引用

@article{arxiv.1604.08740,
  title  = {MetaGrad: Multiple Learning Rates in Online Learning},
  author = {Tim van Erven and Wouter M. Koolen},
  journal= {arXiv preprint arXiv:1604.08740},
  year   = {2021}
}