中文

协作多玩家多臂老虎机的在线学习

机器学习 2021-09-10 v1

摘要

我们引入了一个用于多臂老虎机(MAB)的去中心化在线学习框架,其中包含多个协作玩家。每轮中玩家获得的奖励取决于所有玩家采取的行动。这是一个团队设定,目标是共同的。信息不对称使得该问题既有趣又具有挑战性。我们考虑了三种类型的信息不对称:行动信息不对称,即玩家的行动不可观测但获得的奖励是共享的;奖励信息不对称,即其他玩家的行动可观测但获得的奖励来自同一分布的独立同分布(IID);以及同时存在行动和奖励信息不对称的情况。对于第一种设定,我们提出了一种受 UCB 启发的算法,无论奖励是 IID 还是马尔可夫过程,该算法都能实现 O(logT)O(\log T) 的遗憾。对于第二种设定,我们给出了一个环境,使得为第一种设定设计的算法产生线性遗憾。对于第三种设定,我们证明了“先探索后承诺”算法的一种变体能够实现几乎对数的遗憾。

关键词

引用

@article{arxiv.2109.03818,
  title  = {Online Learning for Cooperative Multi-Player Multi-Armed Bandits},
  author = {William Chang and Mehdi Jafarnia-Jahromi and Rahul Jain},
  journal= {arXiv preprint arXiv:2109.03818},
  year   = {2021}
}