中文

多玩家多臂老虎机的一个最优算法

机器学习 2019-10-29 v2 机器学习

摘要

本文研究多玩家多臂老虎机(MMAB)问题,其中 MM 个决策者或玩家协作以最大化其累积奖励。当多个玩家选择同一臂时,发生碰撞,该臂上不收集任何奖励。参与碰撞的玩家会被告知该碰撞。我们提出 DPE(分散式节俭探索),一种分散式算法,其达到的悔值(regret)与最优集中式算法相同。我们的算法比最先进的算法 SIC-MMAB \cite{boursier2019} 具有更好的悔值保证。与 SIC-MMAB 一样,玩家仅通过碰撞进行通信。DPE 的另一个重要优势是它需要极少的通信。具体而言,玩家使用碰撞进行通信的期望轮数是有限的。

关键词

引用

@article{arxiv.1909.13079,
  title  = {An Optimal Algorithm for Multiplayer Multi-Armed Bandits},
  author = {Alexandre Proutiere and Po-An Wang},
  journal= {arXiv preprint arXiv:1909.13079},
  year   = {2019}
}

备注

14 pages