中文

具有切换代价的赌博机问题:$T^{2/3}$ 遗憾

机器学习 2013-11-21 v2 概率论

摘要

我们研究了在玩家每次切换动作时会产生单位成本的设定下的对抗性多臂赌博机问题。我们证明了在此设定下,玩家的 TT 轮极小极大遗憾为 Θ~(T2/3)\widetilde{\Theta}(T^{2/3}),从而填补了我们对带赌博机反馈学习理解中的一个根本性空白。在对应的全信息版本问题中,已知极小极大遗憾以慢得多的速率 Θ(T)\Theta(\sqrt{T}) 增长。这两种速率之间的差异提供了\emph{首个}迹象,表明带赌博机反馈的学习可能显著难于带全信息反馈的学习(先前的结果仅显示了对动作数量的不同依赖性,而非对 TT 的依赖性)。除了刻画具有切换代价的多臂赌博机问题的内在难度外,我们的结果还解决了在线学习中的几个其他开放性问题。一个直接推论是,针对有界记忆自适应对手的带赌博机反馈学习,其极小极大遗憾为 Θ~(T2/3)\widetilde{\Theta}(T^{2/3})。另一个推论是,对抗性马尔可夫决策过程(MDPs)中在线学习的极小极大遗憾为 Θ~(T2/3)\widetilde{\Theta}(T^{2/3})。我们要所有结果的关键在于一种新的多尺度随机游走的随机构造,该构造具有独立意义,并可能在其他设定中被证明有用。

关键词

引用

@article{arxiv.1310.2997,
  title  = {Bandits with Switching Costs: T^{2/3} Regret},
  author = {Ofer Dekel and Jian Ding and Tomer Koren and Yuval Peres},
  journal= {arXiv preprint arXiv:1310.2997},
  year   = {2013}
}