一类具有选项不可用约束与随机通信协议的多智能体多臂_bandit问题的对数后悔分散策略
机器学习
2020-04-01 v2 统计理论
机器学习
统计理论
摘要
本文考虑一个多臂_bandit (MAB) 问题,其中多个移动智能体通过从一组空间分散的随机过程(称为 bandit)中采样获得奖励。目标是为每个智能体制定分散策略,以在选项可用性与智能体间通信约束下最大化所有智能体的总累积奖励。该问题 formulation 受一类应用启发:一支自主移动机器人团队在不确定的环境中协作完成探索与利用任务。Bandit 位置由空间图的顶点表示。任意时刻,智能体的选项包括在其当前位置采样 bandit,或沿空间图的边移动到新的 bandit 位置。通信约束由一个有向、非平稳、随机通信图描述。任意时刻,智能体仅能从其通信图的入邻接收数据。对于完全连通空间图上的单智能体情形,已知任意最优策略的期望后悔必然以下界受限于随时间的对数增长的函数。一类称为上置信界 (UCB) 算法的策略在经典 MAB 问题中渐近地实现对数的后悔。本文中,我们提出一种基于 UCB 的分散运动与选项选择策略以及一种非平稳随机通信协议,保证对数后悔。据我们所知,这是首个针对具有通信约束的非完全连通空间图的此类分散策略。当空间图完全连通且通信图平稳时,我们的分散算法匹配或超越了文献中报道的最佳已有结果。
引用
@article{arxiv.2003.12968,
title = {A Decentralized Policy with Logarithmic Regret for a Class of Multi-Agent Multi-Armed Bandit Problems with Option Unavailability Constraints and Stochastic Communication Protocols},
author = {Pathmanathan Pankayaraj and D. H. S. Maithripala and J. M. Berg},
journal= {arXiv preprint arXiv:2003.12968},
year = {2020}
}
备注
Pre-print submitted for review to the 2020 CDC