中文

分布式Bandit学习:近最优遗憾与高效通信

机器学习 2019-05-30 v2 机器学习

摘要

我们研究分布式bandit学习的遗憾最小化问题,其中MM个智能体在中心服务器的协调下协作以最小化其总遗憾。我们的目标是设计具有近最优遗憾和较低通信代价的通信协议,通信代价由传输数据总量衡量。对于分布式多臂bandit,我们提出一种具有近最优遗憾且仅有O(Mlog(MK))O(M\log(MK))通信代价的协议,其中KK为臂的数量。该通信代价与时间范围TT无关,仅对数依赖于臂的数量,并且除对数因子外与下界匹配。对于分布式dd维线性bandit,我们提出一种实现近最优遗憾且通信代价为O~(Md)\tilde{O}(Md)量级的协议,其仅对数依赖于TT

关键词

引用

@article{arxiv.1904.06309,
  title  = {Distributed Bandit Learning: Near-Optimal Regret with Efficient Communication},
  author = {Yuanhao Wang and Jiachen Hu and Xiaoyu Chen and Liwei Wang},
  journal= {arXiv preprint arXiv:1904.06309},
  year   = {2019}
}