中文

多智能体多臂_bandit中用于决策的分布式共识算法

机器学习 2023-06-12 v1 多智能体系统 机器学习

摘要

我们研究动态环境中一种结构化的多智能体多臂_bandit(MAMAB)问题。图反映了智能体之间的信息共享结构,臂的收益分布为分段平稳的,带有若干未知变点。智能体面临相同的分段平稳MAB问题。目标是为智能体开发一种决策策略,使后悔值(regret,即每一步未选择最优臂的期望总损失)最小化。我们提出的解决方案——协作上置信界算法中的重启贝叶斯在线变点检测(RBO-Coop-UCB),以一个高效的多智能体UCB算法为核心,并增强了贝叶斯变点检测器。我们还开发了一种简单的重启决策协作机制以改进决策。理论上,我们证明RBO-Coop-UCB的期望群体后悔值上界为O(KNMlogT+KMTlogT)\mathcal{O}(KNM\log T + K\sqrt{MT\log T}),其中K为智能体数量,M为臂的数量,T为时间步数。在合成与真实世界数据集上的数值实验表明,我们提出的方法优于当前最先进(state-of-the-art)的算法。

关键词

引用

@article{arxiv.2306.05998,
  title  = {Distributed Consensus Algorithm for Decision-Making in Multi-agent Multi-armed Bandit},
  author = {Xiaotong Cheng and Setareh Maghsudi},
  journal= {arXiv preprint arXiv:2306.05998},
  year   = {2023}
}