中文

具有安全约束的去中心化多智能体线性_bandit

机器学习 2020-12-02 v1 机器学习

摘要

我们研究去中心化随机线性 bandit,其中由 NN 个智能体组成的网络协作高效地解决 dd 维空间上的线性 bandit 优化问题。针对该问题,我们提出 DLUCB:一种完全去中心化算法,可最小化整个网络上的累积后悔。在算法的每一轮,每个智能体遵循上置信界(UCB)策略选择动作,并通过在周期上重复进行的精心设计的共识过程与直接邻居共享信息。我们的分析调整这些通信周期的时长,以每轮 O(dN2)\mathcal{O}(dN^2) 的通信速率确保近最优后悔性能 O(dlogNTNT)\mathcal{O}(d\log{NT}\sqrt{NT})。网络结构通过一个小的附加项——称为延迟后悔——影响后悔性能,该项取决于底层图的谱间隙。值得注意的是,我们的结果适用于任意网络拓扑,无需专门的服务器智能体。考虑到高通信成本的情形,我们提出 RC-DLUCB:DLUCB 的改进版,智能体间极少通信。新算法以后悔性能换取所有 TT 轮上显著降低的总通信成本 O(d3N2.5)\mathcal{O}(d^3N^{2.5})。最后,我们展示我们的思想可自然扩展到新兴但更具挑战性的安全 bandit 设定。针对近期研究的具有未知线性安全约束的线性 bandit 问题,我们提出首个安全去中心化算法。我们的研究有助于在反复处理未知随机环境的安全关键分布式系统中应用 bandit 技术。我们给出了针对不同网络拓扑的数值模拟,证实了我们的理论发现。

关键词

引用

@article{arxiv.2012.00314,
  title  = {Decentralized Multi-Agent Linear Bandits with Safety Constraints},
  author = {Sanae Amani and Christos Thrampoulidis},
  journal= {arXiv preprint arXiv:2012.00314},
  year   = {2020}
}