中文

分布式对抗性多臂老虎机的近最优 regret:黑箱方法

机器学习 2026-02-09 v1

摘要

我们研究了分布式对抗性多臂老虎机问题,其中N个代理人合作以最小化全局平均损失,但仅观察各自的本地损失。我们表明,该问题的最小混沌 regret为\tilde{\Theta}(\sqrt{(\rho^{-1/2}+K/N)T}),其中T为时域,K为动作数,\rho为通信矩阵的谱间隙。我们的算法基于对延迟反馈老虎机的一种新颖黑箱归约,要求代理人仅通过 gossip 进行通信。它实现的上界显著优于Yi和Vojnovic (2023) 的最佳上界\tilde{O}(\rho^{-1/3}(KT)^{2/3})。我们进一步给出匹配的下界,表明问题的难度可分解为通信成本\rho^{-1/4}\sqrt{T}和老虎机成本\sqrt{KT/N}。我们进一步展示了该方法的通用性,通过推导分布式对抗性情景下的一阶和最佳双世界界,以及扩展框架至\mathbb{R}^d中的分布式线性老虎机,获得的 regret上界为\tilde{O}(\sqrt{(\rho^{-1/2}+1/N)dT}),仅需每代理人每轮O(d)的通信开销,通过体积锥网实现。

关键词

引用

@article{arxiv.2602.06404,
  title  = {Near-Optimal Regret for Distributed Adversarial Bandits: A Black-Box Approach},
  author = {Hao Qiu and Mengxiao Zhang and Nicolò Cesa-Bianchi},
  journal= {arXiv preprint arXiv:2602.06404},
  year   = {2026}
}