中文

基于埃尔朗斯-雷尼随机网络的分布式多主体多臂赌博问题

机器学习 2025-10-28 v1

摘要

我们研究了在随机通信图上进行的分布式多主体多臂赌博问题,其中奖励具有异构性。在每个时间步 tt,agent 之间的通信发生在由埃尔朗斯-雷尼模型生成的时变随机图 GtG_t 上,该随机图基于固定连通基图 GG(对于经典埃尔朗斯-雷尼图,GG 为完全图)生成,其中 GG 中的每个潜在边以链接概率 pp 独立且随机地存在。值得注意的是,结果随机图在每个时间步并非必然连通。每个 agent 的臂奖励遵循时不变分布,且同一臂的奖励分布可能因 agent 而异。目标是最小化相对于每臂全局平均奖励的累积预期后悔,后者定义为该臂在所有 agent 上的平均奖励。为此,我们提出了一种全分布式算法,将臂消除策略与随机 gossip 算法相结合。我们理论上证明了后悔上界为 logT\log T 级别,可解释性强,其中 TT 为时间范围。该上界包含最优集中式后悔 O(k:Δk>0logTΔk)O\left(\sum_{k: \Delta_k>0} \frac{\log T}{\Delta_k}\right) 以及额外项 O(N2logTpλN1(Lap(G))+KN2logTp)O\left(\frac{N^2 \log T}{p \lambda_{N-1}(Lap(G))} + \frac{KN^2 \log T}{p}\right),其中 NNKK 分别表示 agent 总数和臂数。该项反映了 GG 的代数连通性 λN1(Lap(G))\lambda_{N-1}(Lap(G)) 和链接概率 pp 的影响,从而揭示了通信效率与后悔之间的根本权衡。作为副产品,我们还给出近似最优后悔下界。最后,我们的numerical实验不仅显示我们算法在现有基准基线上的优势,还验证了理论后悔随问题复杂度的扩展。

关键词

引用

@article{arxiv.2510.22811,
  title  = {Distributed Multi-Agent Bandits Over Erd\H{o}s-R\'enyi Random Networks},
  author = {Jingyuan Liu and Hao Qiu and Lin Yang and Mengfan Xu},
  journal= {arXiv preprint arXiv:2510.22811},
  year   = {2025}
}