碰撞非零奖励下的分散异构多玩家多臂老虎机
机器学习
2021-12-30 v4 计算机科学与博弈论
机器学习
摘要
我们考虑一个完全分散的多玩家随机多臂老虎机设定,其中玩家之间无法通信,且只能观测自身的动作与奖励。环境对不同玩家可能呈现不同面貌,即给定臂的奖励分布在不同玩家间是异构的。在碰撞情况下(当多于一个玩家选择同一臂时),我们允许发生碰撞的玩家获得非零奖励。玩家游玩臂的时间范围 是未知的。在此设定中,玩家数允许大于臂数,我们提出一种策略,在时长 的时间范围内实现了 (其中 )量级的近阶最优期望后悔。本文已被 IEEE Transactions on Information Theory 接收。
引用
@article{arxiv.1910.09089,
title = {Decentralized Heterogeneous Multi-Player Multi-Armed Bandits with Non-Zero Rewards on Collisions},
author = {Akshayaa Magesh and Venugopal V. Veeravalli},
journal= {arXiv preprint arXiv:1910.09089},
year = {2021}
}