中文

基于统一抽样与共享随机性的分布式核式多臂虫 regret 最优方案

机器学习 2024-02-21 v1 分布式、并行与集群计算 机器学习

摘要

我们考虑分布式核式多臂虫问题,其中 N 个代理人旨在协作最大化驻留于再生产核希尔伯特空间中的未知奖励函数。每个代理人依次查询函数,在查询点处获取带噪观测。代理人可以通过中心服务器共享信息,目标是最小化随时间累积的 regret 并在代理人之间聚合。我们提出了首个实现集中学习中所定义的最优 regret 阶数的算法,其通信成本在 N 和 T 两者上均为亚线性。算法的关键特征包括局部代理人的均匀探索以及与中心服务器的共享随机性。结合高斯过程模型的稀疏近似,这两个关键组件使得在通信成本递减的同时,保留了集中设置的学习速率成为可能。

关键词

引用

@article{arxiv.2402.13182,
  title  = {Order-Optimal Regret in Distributed Kernel Bandits using Uniform Sampling with Shared Randomness},
  author = {Nikola Pavlovic and Sudeep Salgia and Qing Zhao},
  journal= {arXiv preprint arXiv:2402.13182},
  year   = {2024}
}