中文

抗对抗腐败的协作随机多智能体多臂老虎机

机器学习 2021-06-09 v1

摘要

我们研究协作多智能体设定下带对抗腐败的随机多臂老虎机问题,其中 VV 个智能体与共同的 KK-臂老虎机问题交互,且每对智能体可相互通信以加速学习过程。在该问题中,奖励跨所有智能体与轮次独立从分布中采样,但可能被对手腐败。我们的目标是最小化所有智能体的总体后悔与通信代价。我们首先表明,该问题中任何算法的腐败附加项不可避免。随后,我们提出一种对腐败程度不可知的新算法。我们的算法不仅在随机设定下达到近最优后悔,而且在被腐败设定下获得带腐败附加项的后悔,同时保持高效通信。该算法亦适用于单智能体腐败问题,并取得高概率后悔,去除了 KK 对腐败程度的乘性依赖。我们单智能体情形的结果解决了 Gupta 等人 [2019] 的一个开放问题。

关键词

引用

@article{arxiv.2106.04207,
  title  = {Cooperative Stochastic Multi-agent Multi-armed Bandits Robust to Adversarial Corruptions},
  author = {Junyan Liu and Shuai Li and Dapeng Li},
  journal= {arXiv preprint arXiv:2106.04207},
  year   = {2021}
}