中文

组合半赌博机、线性赌博机与 MDP 的非随机延迟反馈统一分析

机器学习 2023-05-16 v1

摘要

我们推导了带延迟赌博机反馈的在线学习中 Follow The Regularized Leader (FTRL) 的新分析。通过将延迟反馈的代价与赌博机反馈的代价分离,我们的分析使我们能够在三个重要设定中获得新结果。一方面,我们推导了带延迟的组合半赌博机和对抗马尔可夫决策过程(具有延迟且转移函数已知)的首个最优(至多对数因子)后悔界。另一方面,我们利用我们的分析推导了一种高效的带延迟线性赌博机算法,实现了近最优后悔界。我们新颖的后悔分解表明,在正则化项 Hessian 的温和假设下,FTRL 在多个轮次中保持稳定性。

关键词

引用

@article{arxiv.2305.08629,
  title  = {A Unified Analysis of Nonstochastic Delayed Feedback for Combinatorial Semi-Bandits, Linear Bandits, and MDPs},
  author = {Dirk van der Hoeven and Lukas Zierahn and Tal Lancewicki and Aviv Rosenberg and Nicoló Cesa-Bianchi},
  journal= {arXiv preprint arXiv:2305.08629},
  year   = {2023}
}