中文

从老虎机到专家:论侧面观察的价值

机器学习 2011-10-26 v3 机器学习

摘要

我们考虑一个对抗性在线学习环境,其中决策者在游戏的每一阶段可以选择一个动作。除了观察到所选动作的奖励外,决策者还能获得关于如果他选择其他某些动作本可获得的奖励的侧面观察。观察结构被编码为一个图,其中如果采样节点 i 能提供关于节点 j 奖励的信息,则节点 i 与节点 j 相连。这一环境自然地介于众所周知的“专家”环境(决策者可查看所有奖励)与多臂老虎机环境(决策者只能查看所选动作的奖励)之间。我们开发了具有可证明遗憾保证的实用算法,这些保证依赖于信息反馈结构的非平凡图论性质。我们还提供了部分匹配的下界。

关键词

引用

@article{arxiv.1106.2436,
  title  = {From Bandits to Experts: On the Value of Side-Observations},
  author = {Shie Mannor and Ohad Shamir},
  journal= {arXiv preprint arXiv:1106.2436},
  year   = {2011}
}

备注

Presented at the NIPS 2011 conference