中文

对对抗性碰撞鲁棒的多玩家_bandits

机器学习 2022-11-16 v1 机器学习

摘要

受认知无线电的推动,随机多玩家多臂_bandits 近年来被广泛研究。在该设定中,每个玩家拉取一个臂,若无碰撞(即该臂仅被单一玩家选择)则获得对应臂的奖励;否则若发生碰撞,玩家无奖励。本文考虑存在恶意玩家(或攻击者)通过故意与协作玩家(或防御者)发生碰撞来阻碍其最大化奖励的情况。我们为防御者提供了首个去中心化且鲁棒的算法 RESYNC,其性能随攻击者引发的碰撞数 CC 增加以 O~(C)\tilde{O}(C) 的速度平缓退化。我们通过证明随 Ω(C)\Omega(C) 缩放的下界,表明该算法是阶最优的。该算法对攻击者所用算法以及所面临攻击者碰撞数 CC 均无需知晓。

关键词

引用

@article{arxiv.2211.07817,
  title  = {Multi-Player Bandits Robust to Adversarial Collisions},
  author = {Shivakumar Mahesh and Anshuka Rangi and Haifeng Xu and Long Tran-Thanh},
  journal= {arXiv preprint arXiv:2211.07817},
  year   = {2022}
}