中文

具有连续变化的在线学习:动态遗憾与归约

机器学习 2022-04-06 v4 最优化与控制 机器学习

摘要

在线学习是分析迭代算法的有力工具。然而,经典的对抗式设定有时无法捕捉实际在线问题中的某些规律性。受此启发,我们建立了一个称为连续在线学习(COL)的新设定,其中在线损失函数的梯度随学习者的决策在轮次间连续变化。我们表明 COL 涵盖并更恰当地描述了许多有趣的应用,从一般均衡问题(EPs)到情节式 MDP 中的优化。特别地,我们表明单调 EPs 可归约为在 COL 中实现亚线性静态遗憾。利用这一新设定,我们重新审视了亚线性动态遗憾的困难性。我们证明了在 COL 中实现亚线性动态遗憾与求解某些 EPs 之间的基本等价性。基于这一洞见,我们给出了高效算法实现亚线性动态遗憾的条件,即使损失被自适应地选择而没有任何先验变化预算。此外,我们展示了对于 COL 从动态遗憾到关联 EP 中静态遗憾与收敛性的归约,使我们能够分析许多现有算法的动态遗憾。

关键词

引用

@article{arxiv.1902.07286,
  title  = {Online Learning with Continuous Variations: Dynamic Regret and Reductions},
  author = {Ching-An Cheng and Jonathan Lee and Ken Goldberg and Byron Boots},
  journal= {arXiv preprint arXiv:1902.07286},
  year   = {2022}
}