中文

多玩家老虎机:一种跋涉方法

机器学习 2018-09-18 v1 机器学习

摘要

我们研究具有多名玩家的随机多臂老虎机问题。玩家不知道玩家数量,无法相互通信,且若多名玩家选择同一臂则发生碰撞,均无法获得任何奖励。我们考虑静态场景(玩家数量固定)和动态场景(玩家可随时进入和离开)。我们提供了基于一种新颖“跋涉方法”的算法,以高概率保证静态情形下的常数后悔和动态情形下的次线性后悔。该跋涉方法无需估计玩家数量,从而与最先进算法相比减少了碰撞并改善了后悔性能。我们还开发了一种无纪元算法,消除了玩家间任何时间同步的要求,只要每个玩家能检测到其他玩家在某臂上的存在。我们使用基于仿真和真实测试平台的实验验证了我们的理论保证。

关键词

引用

@article{arxiv.1809.06040,
  title  = {Multi-Player Bandits: A Trekking Approach},
  author = {Manjesh K. Hanawal and Sumit J. Darak},
  journal= {arXiv preprint arXiv:1809.06040},
  year   = {2018}
}