向现实更进一步:具有不完美通信的协作老虎机
机器学习
2021-11-25 v1 机器学习
摘要
协作老虎机问题因其在大规模决策中的应用而变得越来越重要。然而,该问题的大部分研究仅关注完美通信的设置,而在大多数现实世界的分布式设置中,通信通常是在具有任意损坏和延迟的随机网络上进行的。在本文中,我们研究了三种典型现实世界通信场景下的协作老虎机学习,即:(a) 在随机时变网络上的消息传递,(b) 在具有随机延迟的网络上的即时奖励共享,以及 (c) 带有对抗性损坏奖励(包括拜占庭通信)的消息传递。针对每种环境,我们都提出了能够实现竞争性能的去中心化算法,并在产生的群体遗憾上也提供了近乎最优的保证。此外,在完美通信的设置下,我们提出了一种改进的延迟更新算法,该算法在各种网络拓扑上的性能优于现有的最先进技术。最后,我们给出了群体遗憾的紧致网络相关极小极大下界。我们提出的算法易于实现,并获得了有竞争力的实证性能。
引用
@article{arxiv.2111.12482,
title = {One More Step Towards Reality: Cooperative Bandits with Imperfect Communication},
author = {Udari Madhushani and Abhimanyu Dubey and Naomi Ehrich Leonard and Alex Pentland},
journal= {arXiv preprint arXiv:2111.12482},
year = {2021}
}