分布式Bandit学习:近最优遗憾与高效通信
机器学习
2019-05-30 v2 机器学习
摘要
我们研究分布式bandit学习的遗憾最小化问题,其中个智能体在中心服务器的协调下协作以最小化其总遗憾。我们的目标是设计具有近最优遗憾和较低通信代价的通信协议,通信代价由传输数据总量衡量。对于分布式多臂bandit,我们提出一种具有近最优遗憾且仅有通信代价的协议,其中为臂的数量。该通信代价与时间范围无关,仅对数依赖于臂的数量,并且除对数因子外与下界匹配。对于分布式维线性bandit,我们提出一种实现近最优遗憾且通信代价为量级的协议,其仅对数依赖于。
引用
@article{arxiv.1904.06309,
title = {Distributed Bandit Learning: Near-Optimal Regret with Efficient Communication},
author = {Yuanhao Wang and Jiachen Hu and Xiaoyu Chen and Liwei Wang},
journal= {arXiv preprint arXiv:1904.06309},
year = {2019}
}