中文

碰撞非零奖励下的分散异构多玩家多臂老虎机

机器学习 2021-12-30 v4 计算机科学与博弈论 机器学习

摘要

我们考虑一个完全分散的多玩家随机多臂老虎机设定,其中玩家之间无法通信,且只能观测自身的动作与奖励。环境对不同玩家可能呈现不同面貌,即给定臂的奖励分布在不同玩家间是异构的。在碰撞情况下(当多于一个玩家选择同一臂时),我们允许发生碰撞的玩家获得非零奖励。玩家游玩臂的时间范围 TT 是未知的。在此设定中,玩家数允许大于臂数,我们提出一种策略,在时长 TT 的时间范围内实现了 O(log1+δT)O(\log^{1 + \delta} T)(其中 0<δ<10 < \delta < 1)量级的近阶最优期望后悔。本文已被 IEEE Transactions on Information Theory 接收。

关键词

引用

@article{arxiv.1910.09089,
  title  = {Decentralized Heterogeneous Multi-Player Multi-Armed Bandits with Non-Zero Rewards on Collisions},
  author = {Akshayaa Magesh and Venugopal V. Veeravalli},
  journal= {arXiv preprint arXiv:1910.09089},
  year   = {2021}
}