中文

反馈图在线学习的最佳全场景界

机器学习 2021-07-21 v1

摘要

我们研究由 Mannor 和 Shamir (2011) 引入的带反馈图的在线学习框架,其中在线学习器接收到的反馈由可用动作上的图 GG 指定。我们开发了一种算法,同时实现以下形式的后悔界:O(θ(G)T)\smash{\mathcal{O}(\sqrt{\theta(G) T})}(对抗性损失);O(θ(G)polylogT)\mathcal{O}(\theta(G)\operatorname{polylog}{T})(随机损失);以及 O(θ(G)polylogT+θ(G)C)\mathcal{O}(\theta(G)\operatorname{polylog}{T} + \smash{\sqrt{\theta(G) C})}(受 CC 个对抗性损坏的随机损失)。此处 θ(G)\theta(G) 为图 GG 的团覆盖数。我们的算法是 Follow-the-Regularized-Leader 的一个实例,采用一种新颖的正则化,可视为 Tsallis 熵分量(受 Zimmert 和 Seldin (2019) 启发)与 Shannon 熵分量(在损坏随机情形由 Amir 等人 (2020) 分析)的乘积,从而微妙地在这两种熵形式间插值。我们的关键技术贡献之一在于确立该正则化子的凸性并控制其逆 Hessian,尽管其具有复杂的乘积结构。

关键词

引用

@article{arxiv.2107.09572,
  title  = {Best-of-All-Worlds Bounds for Online Learning with Feedback Graphs},
  author = {Liad Erez and Tomer Koren},
  journal= {arXiv preprint arXiv:2107.09572},
  year   = {2021}
}