多智能体多臂老虎机中的社会学习
机器学习
2019-11-06 v3 分布式、并行与集群计算
网络与互联网体系结构
社会与信息网络
概率论
机器学习
摘要
在本文中,我们引入了经典随机多臂老虎机(MAB)问题的分布式版本。我们的设定包含大量智能体 ,它们协作并同时求解同一个 臂 MAB 实例,以最小化所有智能体上的平均累积遗憾。智能体之间只能通过一个成对异步基于 gossip 的协议进行通信与协作,该协议仅交换有限的比特数。在我们的模型中,智能体在每一时刻决定 (i) 玩哪条臂,(ii) 是否通信,若通信则 (iii) 通信什么以及和谁通信。我们模型中的智能体是去中心化的,即它们的动作仅依赖于其过去观测到的历史。我们开发了一种新颖算法,其中智能体在任意选择通信时,仅与均匀且独立随机选取的另一个智能体交换臂编号而非样本。我们的算法实现的每智能体遗憾缩放为 。此外,我们的算法中任一智能体在 的时间区间内仅总共通信 次。我们将我们的结果与两个基准进行比较——一个是无智能体间通信的基准,另一个对应完全交互的基准。我们从理论和经验上均表明,与智能体不协作的情况相比,我们的算法在每智能体遗憾上显著减少,而与完整交互设定(该设定要求智能体在 次臂拉动中进行 次通信尝试)相比,在通信复杂度上显著减少。
引用
@article{arxiv.1910.02100,
title = {Social Learning in Multi Agent Multi Armed Bandits},
author = {Abishek Sankararaman and Ayalvadi Ganesh and Sanjay Shakkottai},
journal= {arXiv preprint arXiv:1910.02100},
year = {2019}
}
备注
Minor Corrections from before