中文

具有切换成本及其他自适应对手的在线学习

机器学习 2013-06-04 v2 机器学习

摘要

我们研究了在专家建议预测设置中,不同类型的自适应(非遗忘型)对手的能力,涵盖了全信息反馈和多臂老虎机 (bandit) 反馈两种情况。我们使用一种新的遗憾 (regret) 概念(也称为策略遗憾) 来衡量玩家的表现,该概念能更好地捕捉对手对玩家行为的适应性。在允许损失漂移的设置中,我们近乎完整地刻画了具有有界记忆和切换成本的自适应对手的能力。特别是,我们表明在存在切换成本的情况下,多臂老虎机反馈可达到的速率为 Θ~(T2/3)\widetilde{\Theta}(T^{2/3})。有趣的是,这一速率显著差于全信息情况下具有切换成本时可达到 Θ(T)\Theta(\sqrt{T}) 速率。通过一种从专家到老虎机的新颖归约,我们还表明,即使在全信息情况下,有界记忆对手也能迫使 Θ~(T2/3)\widetilde{\Theta}(T^{2/3}) 的遗憾,从而证明切换成本比有界记忆对手更容易控制。我们的下界依赖于一种新的随机对手策略,该策略生成具有强依赖性的损失过程。

关键词

引用

@article{arxiv.1302.4387,
  title  = {Online Learning with Switching Costs and Other Adaptive Adversaries},
  author = {Nicolo Cesa-Bianchi and Ofer Dekel and Ohad Shamir},
  journal= {arXiv preprint arXiv:1302.4387},
  year   = {2013}
}