抗对抗腐败的协作随机多智能体多臂老虎机
机器学习
2021-06-09 v1
摘要
我们研究协作多智能体设定下带对抗腐败的随机多臂老虎机问题,其中 个智能体与共同的 -臂老虎机问题交互,且每对智能体可相互通信以加速学习过程。在该问题中,奖励跨所有智能体与轮次独立从分布中采样,但可能被对手腐败。我们的目标是最小化所有智能体的总体后悔与通信代价。我们首先表明,该问题中任何算法的腐败附加项不可避免。随后,我们提出一种对腐败程度不可知的新算法。我们的算法不仅在随机设定下达到近最优后悔,而且在被腐败设定下获得带腐败附加项的后悔,同时保持高效通信。该算法亦适用于单智能体腐败问题,并取得高概率后悔,去除了 对腐败程度的乘性依赖。我们单智能体情形的结果解决了 Gupta 等人 [2019] 的一个开放问题。
引用
@article{arxiv.2106.04207,
title = {Cooperative Stochastic Multi-agent Multi-armed Bandits Robust to Adversarial Corruptions},
author = {Junyan Liu and Shuai Li and Dapeng Li},
journal= {arXiv preprint arXiv:2106.04207},
year = {2021}
}