中文

异步联邦上下文线性_bandits 的一种简单且可证高效的算法

机器学习 2022-07-08 v1 机器学习

摘要

我们研究联邦上下文线性 bandits,其中 MM 个智能体相互协作,在中心服务器的帮助下求解一个全局上下文线性 bandit 问题。我们考虑异步设定,其中所有智能体独立工作,且一个智能体与服务器之间的通信不会触发其他智能体的通信。我们基于乐观原则提出了一种名为 \texttt{FedLinUCB} 的简单算法。我们证明 \texttt{FedLinUCB} 的 regret 上界为 O~(dm=1MTm)\tilde{O}(d\sqrt{\sum_{m=1}^M T_m}),通信复杂度为 O~(dM2)\tilde{O}(dM^2),其中 dd 是上下文向量的维度,TmT_m 是第 mm 个智能体与环境的总交互次数。据我们所知,这是首个允许联邦上下文线性 bandits 完全异步通信且在单智能体设定下达到相同 regret 保证的可证高效算法。

关键词

引用

@article{arxiv.2207.03106,
  title  = {A Simple and Provably Efficient Algorithm for Asynchronous Federated Contextual Linear Bandits},
  author = {Jiafan He and Tianhao Wang and Yifei Min and Quanquan Gu},
  journal= {arXiv preprint arXiv:2207.03106},
  year   = {2022}
}

备注

25 pages, 1 figure, 2 tables