基于埃尔朗斯-雷尼随机网络的分布式多主体多臂赌博问题
机器学习
2025-10-28 v1
摘要
我们研究了在随机通信图上进行的分布式多主体多臂赌博问题,其中奖励具有异构性。在每个时间步 ,agent 之间的通信发生在由埃尔朗斯-雷尼模型生成的时变随机图 上,该随机图基于固定连通基图 (对于经典埃尔朗斯-雷尼图, 为完全图)生成,其中 中的每个潜在边以链接概率 独立且随机地存在。值得注意的是,结果随机图在每个时间步并非必然连通。每个 agent 的臂奖励遵循时不变分布,且同一臂的奖励分布可能因 agent 而异。目标是最小化相对于每臂全局平均奖励的累积预期后悔,后者定义为该臂在所有 agent 上的平均奖励。为此,我们提出了一种全分布式算法,将臂消除策略与随机 gossip 算法相结合。我们理论上证明了后悔上界为 级别,可解释性强,其中 为时间范围。该上界包含最优集中式后悔 以及额外项 ,其中 和 分别表示 agent 总数和臂数。该项反映了 的代数连通性 和链接概率 的影响,从而揭示了通信效率与后悔之间的根本权衡。作为副产品,我们还给出近似最优后悔下界。最后,我们的numerical实验不仅显示我们算法在现有基准基线上的优势,还验证了理论后悔随问题复杂度的扩展。
引用
@article{arxiv.2510.22811,
title = {Distributed Multi-Agent Bandits Over Erd\H{o}s-R\'enyi Random Networks},
author = {Jingyuan Liu and Hao Qiu and Lin Yang and Mengfan Xu},
journal= {arXiv preprint arXiv:2510.22811},
year = {2025}
}