异步联邦上下文线性_bandits 的一种简单且可证高效的算法
机器学习
2022-07-08 v1 机器学习
摘要
我们研究联邦上下文线性 bandits,其中 个智能体相互协作,在中心服务器的帮助下求解一个全局上下文线性 bandit 问题。我们考虑异步设定,其中所有智能体独立工作,且一个智能体与服务器之间的通信不会触发其他智能体的通信。我们基于乐观原则提出了一种名为 \texttt{FedLinUCB} 的简单算法。我们证明 \texttt{FedLinUCB} 的 regret 上界为 ,通信复杂度为 ,其中 是上下文向量的维度, 是第 个智能体与环境的总交互次数。据我们所知,这是首个允许联邦上下文线性 bandits 完全异步通信且在单智能体设定下达到相同 regret 保证的可证高效算法。
引用
@article{arxiv.2207.03106,
title = {A Simple and Provably Efficient Algorithm for Asynchronous Federated Contextual Linear Bandits},
author = {Jiafan He and Tianhao Wang and Yifei Min and Quanquan Gu},
journal= {arXiv preprint arXiv:2207.03106},
year = {2022}
}
备注
25 pages, 1 figure, 2 tables