中文

无通信多玩家多臂老虎机中实例相关保证的帕累托边界

机器学习 2022-06-08 v2 多智能体系统 机器学习

摘要

我们研究随机多玩家多臂老虎机问题。在该问题中,mm 个玩家合作以最大化来自 K>mK > m 个臂的总奖励。然而玩家之间不能通信,且若在同一时间拉取同一臂则会受到惩罚(例如未获得奖励)。我们探讨是否可能获得最优的实例相关后悔界 O~(1/Δ)\tilde{O}(1/\Delta),其中 Δ\Delta 为第 mm 优与第 m+1m+1 优臂之间的差距。此类保证近来在允许玩家通过有意碰撞进行隐式通信的模型中得以实现。令人惊讶的是,我们证明在完全无通信的情况下,此类保证是不可实现的。事实上,对某些 Δ\Delta 值获得最优的 O~(1/Δ)\tilde{O}(1/\Delta) 后悔界必然意味着在其他情形下出现严格次优的后悔界。我们的主要结果是对无通信下可能的帕累托最优实例相关权衡的完整刻画。我们的算法推广了 Bubeck、Budzinski 和第二作者之算法。如同该工作,得益于强无碰撞性质,即便碰撞反馈可被自适应对手篡改,我们的算法仍能成功。我们的下界基于多尺度拓扑阻碍,且完全是新颖的。

关键词

引用

@article{arxiv.2202.09653,
  title  = {The Pareto Frontier of Instance-Dependent Guarantees in Multi-Player Multi-Armed Bandits with no Communication},
  author = {Allen Liu and Mark Sellke},
  journal= {arXiv preprint arXiv:2202.09653},
  year   = {2022}
}

备注

Accepted for presentation at Conference on Learning Theory (COLT) 2022