中文

具有噪声奖励且无通信的最优协作多人学习_bandit

机器学习 2023-11-13 v1 多智能体系统 机器学习

摘要

我们考虑一个协作多人 bandit 学习问题,其中玩家仅被允许事先商定一个策略,但在学习过程中不能通信。在该问题中,每个玩家同时选择一个动作。基于所有玩家选择的动作,玩家团队获得一个奖励。所有玩家的动作被共同观测到。然而,每个玩家接收到该奖励的一个噪声版本,且无法与其他玩家共享。由于玩家可能接收到不同的奖励,在用于选择动作的信息上存在不对称性。在本文中,我们提供一种基于上置信界与下置信界的算法,玩家可借此在奖励信息不对称的情况下选择其最优动作。我们证明该算法可实现对数 O(logTΔa)O(\frac{\log T}{\Delta_{\bm{a}}})(依赖于间隙的)后悔以及 O(TlogT)O(\sqrt{T\log T})(独立于间隙的)后悔。这在 TT 上是渐近最优的。我们还表明,其在经验上优于当前该环境下最先进的算法。

关键词

引用

@article{arxiv.2311.06210,
  title  = {Optimal Cooperative Multiplayer Learning Bandits with Noisy Rewards and No Communication},
  author = {William Chang and Yuanhao Lu},
  journal= {arXiv preprint arXiv:2311.06210},
  year   = {2023}
}