对对抗性碰撞鲁棒的多玩家_bandits
机器学习
2022-11-16 v1 机器学习
摘要
受认知无线电的推动,随机多玩家多臂_bandits 近年来被广泛研究。在该设定中,每个玩家拉取一个臂,若无碰撞(即该臂仅被单一玩家选择)则获得对应臂的奖励;否则若发生碰撞,玩家无奖励。本文考虑存在恶意玩家(或攻击者)通过故意与协作玩家(或防御者)发生碰撞来阻碍其最大化奖励的情况。我们为防御者提供了首个去中心化且鲁棒的算法 RESYNC,其性能随攻击者引发的碰撞数 增加以 的速度平缓退化。我们通过证明随 缩放的下界,表明该算法是阶最优的。该算法对攻击者所用算法以及所面临攻击者碰撞数 均无需知晓。
引用
@article{arxiv.2211.07817,
title = {Multi-Player Bandits Robust to Adversarial Collisions},
author = {Shivakumar Mahesh and Anshuka Rangi and Haifeng Xu and Long Tran-Thanh},
journal= {arXiv preprint arXiv:2211.07817},
year = {2022}
}