中文

基于反馈图的在线学习:超越多臂老虎机

机器学习 2015-02-27 v1

摘要

我们研究了一类由图指定反馈的在线学习问题。该类问题包括带专家建议的在线预测和多臂老虎机问题,但也包含在线玩家不一定能观察到自身损失的若干学习问题。我们分析了反馈图的结构如何控制由此引发的 TT 轮学习问题的固有难度。具体而言,我们证明了任何反馈图均属于以下三类之一:强可观测图、弱可观测图和不可观测图。我们证明,第一类引发的学习问题具有 Θ~(α1/2T1/2)\widetilde\Theta(\alpha^{1/2} T^{1/2}) 的极小极大遗憾,其中 α\alpha 是底层图的独立数;第二类引发的问题具有 Θ~(δ1/3T2/3)\widetilde\Theta(\delta^{1/3}T^{2/3}) 的极小极大遗憾,其中 δ\delta 是图某部分的支配数;第三类引发的问题具有线性极小极大遗憾。我们的结果涵盖了此前关于反馈图学习的大部分工作,并揭示了其与部分监控博弈的新联系。我们还展示了若允许图随时间变化,遗憾将如何受到影响。

关键词

引用

@article{arxiv.1502.07617,
  title  = {Online Learning with Feedback Graphs: Beyond Bandits},
  author = {Noga Alon and Nicolò Cesa-Bianchi and Ofer Dekel and Tomer Koren},
  journal= {arXiv preprint arXiv:1502.07617},
  year   = {2015}
}