具有重尾特性的协作多智能体_bandit问题
机器学习
2020-08-17 v1 多智能体系统
机器学习
摘要
我们研究了协作多智能体设定下的重尾随机 bandit 问题,其中一组智能体与共同的 bandit 问题交互,同时在一个具有延迟的网络上通信。该设定下现有随机 bandit 算法利用基于平均的通信协议(称为运行共识,running consensus)所产生的置信区间,该协议不适用于重尾设定下的鲁棒估计。我们提出 \textsc{MP-UCB},一种用于协作随机 bandit 的去中心化多智能体算法,它将鲁棒估计与消息传递协议相结合。我们证明了 \textsc{MP-UCB} 在多种问题设定下的最优后悔界,并展示了其相对于现有方法的优越性。此外,我们建立了协作 bandit 问题的首个下界,并提供了用于位置鲁棒 bandit 估计的高效算法。
引用
@article{arxiv.2008.06244,
title = {Cooperative Multi-Agent Bandits with Heavy Tails},
author = {Abhimanyu Dubey and Alex Pentland},
journal= {arXiv preprint arXiv:2008.06244},
year = {2020}
}
备注
26 pages including appendix, camera-ready for ICML 2020