中文

多智能体多臂老虎机中的社会学习

机器学习 2019-11-06 v3 分布式、并行与集群计算 网络与互联网体系结构 社会与信息网络 概率论 机器学习

摘要

在本文中,我们引入了经典随机多臂老虎机(MAB)问题的分布式版本。我们的设定包含大量智能体 nn,它们协作并同时求解同一个 KK 臂 MAB 实例,以最小化所有智能体上的平均累积遗憾。智能体之间只能通过一个成对异步基于 gossip 的协议进行通信与协作,该协议仅交换有限的比特数。在我们的模型中,智能体在每一时刻决定 (i) 玩哪条臂,(ii) 是否通信,若通信则 (iii) 通信什么以及和谁通信。我们模型中的智能体是去中心化的,即它们的动作仅依赖于其过去观测到的历史。我们开发了一种新颖算法,其中智能体在任意选择通信时,仅与均匀且独立随机选取的另一个智能体交换臂编号而非样本。我们的算法实现的每智能体遗憾缩放为 O(Kn+log(n)Δlog(T)+log3(n)loglog(n)Δ2)O \left( \frac{\lceil\frac{K}{n}\rceil+\log(n)}{\Delta} \log(T) + \frac{\log^3(n) \log \log(n)}{\Delta^2} \right)。此外,我们的算法中任一智能体在 TT 的时间区间内仅总共通信 Θ(log(T))\Theta(\log(T)) 次。我们将我们的结果与两个基准进行比较——一个是无智能体间通信的基准,另一个对应完全交互的基准。我们从理论和经验上均表明,与智能体不协作的情况相比,我们的算法在每智能体遗憾上显著减少,而与完整交互设定(该设定要求智能体在 TT 次臂拉动中进行 TT 次通信尝试)相比,在通信复杂度上显著减少。

关键词

引用

@article{arxiv.1910.02100,
  title  = {Social Learning in Multi Agent Multi Armed Bandits},
  author = {Abishek Sankararaman and Ayalvadi Ganesh and Sanjay Shakkottai},
  journal= {arXiv preprint arXiv:1910.02100},
  year   = {2019}
}

备注

Minor Corrections from before