反馈图在线学习的最佳全场景界
机器学习
2021-07-21 v1
摘要
我们研究由 Mannor 和 Shamir (2011) 引入的带反馈图的在线学习框架,其中在线学习器接收到的反馈由可用动作上的图 指定。我们开发了一种算法,同时实现以下形式的后悔界:(对抗性损失);(随机损失);以及 (受 个对抗性损坏的随机损失)。此处 为图 的团覆盖数。我们的算法是 Follow-the-Regularized-Leader 的一个实例,采用一种新颖的正则化,可视为 Tsallis 熵分量(受 Zimmert 和 Seldin (2019) 启发)与 Shannon 熵分量(在损坏随机情形由 Amir 等人 (2020) 分析)的乘积,从而微妙地在这两种熵形式间插值。我们的关键技术贡献之一在于确立该正则化子的凸性并控制其逆 Hessian,尽管其具有复杂的乘积结构。
引用
@article{arxiv.2107.09572,
title = {Best-of-All-Worlds Bounds for Online Learning with Feedback Graphs},
author = {Liad Erez and Tomer Koren},
journal= {arXiv preprint arXiv:2107.09572},
year = {2021}
}