中文

通信式多玩家多臂老虎机问题的渐近最优算法

机器学习 2017-12-05 v1

摘要

我们考虑一个带有多个玩家的去中心化随机多臂老虎机问题。每个玩家旨在通过拉动一个臂来最大化自己的奖励。各臂基于独立同分布的随机 Bernoulli 分布给出奖励。玩家不知道各臂的概率分布。在每一轮结束时,玩家将其所拉动的臂及所得奖励告知其邻居。玩家的邻居根据连通性为 α\alpha 的 Erdős-Rényi 图确定。该图在每轮开始时以相同连通性重新生成。当在一轮中有多于一个玩家选择同一臂时,我们假设仅被随机选中的其中一个玩家获得奖励,其余玩家一无所获。我们首先假设玩家不知道碰撞模型,并为 α=1\alpha = 1 的情形给出一种渐近最优算法。随后,我们扩展先前工作,在假设玩家知晓碰撞模型的前提下,为除零以外的任意连通性给出一种渐近最优算法。我们还通过与传统多臂老虎机算法比较,实证研究了玩家间通信程度 α\alpha 对累积遗憾的影响。

关键词

引用

@article{arxiv.1712.00656,
  title  = {An Asymptotically Optimal Algorithm for Communicating Multiplayer Multi-Armed Bandit Problems},
  author = {Noyan Evirgen and Alper Kose and Hakan Gokcesu},
  journal= {arXiv preprint arXiv:1712.00656},
  year   = {2017}
}

备注

This work is an extension of the paper [arXiv:1711.01628] which has been accepted to the 2017 IEEE ICMLA and submitted to Elsevier Signal Processing