中文

有限通信下的多智能体多臂老虎机

机器学习 2021-02-18 v1 人工智能 多智能体系统

摘要

我们考虑 NN 个智能体协作地与一个随机 KK 臂老虎机实例交互的问题,其中 KNK \gg N。这些智能体旨在同时最小化所有智能体在总共 TT 个时间步上的累积后悔、通信轮数以及每轮通信的比特数。我们提出有限通信协作-上置信界(LCC-UCB),一种基于倍增周期的算法,其中每个智能体仅在该周期结束时进行通信,并共享其所知最优臂的索引。使用我们的算法 LCC-UCB,每个智能体享有 O~((K/N+N)T)\tilde{O}\left(\sqrt{({K/N}+ N)T}\right) 的后悔,通信 O(logT)O(\log T) 步,并在每步通信中广播 O(logK)O(\log K) 比特。我们将该工作扩展到最大度数为 KGK_G、直径为 DD 的稀疏图,并提出 LCC-UCB-GRAPH,其享有 O~(D(K/N+KG)DT)\tilde{O}\left(D\sqrt{(K/N+ K_G)DT}\right) 的后悔界。最后,我们通过实验表明 LCC-UCB 与 LCC-UCB-GRAPH 算法表现良好,并且优于通过中心节点通信的策略。

关键词

引用

@article{arxiv.2102.08462,
  title  = {Multi-Agent Multi-Armed Bandits with Limited Communication},
  author = {Mridul Agarwal and Vaneet Aggarwal and Kamyar Azizzadenesheli},
  journal= {arXiv preprint arXiv:2102.08462},
  year   = {2021}
}