基于反馈图的在线学习:超越多臂老虎机
机器学习
2015-02-27 v1
摘要
我们研究了一类由图指定反馈的在线学习问题。该类问题包括带专家建议的在线预测和多臂老虎机问题,但也包含在线玩家不一定能观察到自身损失的若干学习问题。我们分析了反馈图的结构如何控制由此引发的 轮学习问题的固有难度。具体而言,我们证明了任何反馈图均属于以下三类之一:强可观测图、弱可观测图和不可观测图。我们证明,第一类引发的学习问题具有 的极小极大遗憾,其中 是底层图的独立数;第二类引发的问题具有 的极小极大遗憾,其中 是图某部分的支配数;第三类引发的问题具有线性极小极大遗憾。我们的结果涵盖了此前关于反馈图学习的大部分工作,并揭示了其与部分监控博弈的新联系。我们还展示了若允许图随时间变化,遗憾将如何受到影响。
引用
@article{arxiv.1502.07617,
title = {Online Learning with Feedback Graphs: Beyond Bandits},
author = {Noga Alon and Nicolò Cesa-Bianchi and Ofer Dekel and Tomer Koren},
journal= {arXiv preprint arXiv:1502.07617},
year = {2015}
}