中文

跟随正则化领导者算法的自适应学习率:竞争分析与两全其美

机器学习 2024-03-12 v2 机器学习

摘要

跟随正则化领导者(FTRL)被认为是在线学习中一种有效且通用的方法,其中适当选择学习率对于减小遗憾至关重要。为此,我们将调整 FTRL 学习率的问题表述为序列决策问题,并引入了竞争分析框架。我们建立了竞争比的下界,并提出了学习率更新规则,该规则实现了在该下界常数因子范围内的上界。具体而言,我们说明了最优竞争比由惩罚项分量的(近似)单调性特征化,表明如果惩罚项分量形成单调非增序列,则可实现恒定的竞争比,并推导了当惩罚项为ξ\xi-近似单调非增时的紧竞争比。我们提出的更新规则(称为\textit{稳定性 - 惩罚匹配})也有助于为随机环境和对抗环境构建两全其美(BOBW)算法。在这些环境中,我们的结果有助于实现更紧的遗憾界,并扩大算法在多臂老虎机、图老虎机、线性老虎机和上下文老虎机等各种设置中的适用性。

关键词

引用

@article{arxiv.2403.00715,
  title  = {Adaptive Learning Rate for Follow-the-Regularized-Leader: Competitive Analysis and Best-of-Both-Worlds},
  author = {Shinji Ito and Taira Tsuchiya and Junya Honda},
  journal= {arXiv preprint arXiv:2403.00715},
  year   = {2024}
}