中文

异构多玩家多臂老虎机对抗性攻击的鲁棒性

机器学习 2025-01-31 v1 机器学习

摘要

我们考虑的是在存在对抗者的情况下的多玩家多臂老虎机问题,这些对抗者试图以负面方式影响系统中玩家所接收的奖励。对于给定的臂,奖励分布在玩家之间是异构的。在发生碰撞(超过一个玩家选择同一臂)时,所有碰撞的用户将获得零奖励。对抗者利用碰撞来影响玩家所接收的奖励,即如果对抗者攻击某个臂,则选择该臂的任何玩家将获得零奖励。在任意时间步,對抗者可以攻击多个臂。假设系统中的玩家不会偏离所有玩家使用的预定策略,且每个时间步上没有臂面临对抗攻击的概率严格为正。为了抵抗对抗性攻击,允许玩家在 O(logT)O(\log T) 个时间单位内进行通信,其中 TT 为时间范围,每个玩家只能在所有时间步上观察自己的动作和奖励。我们提出的策略用于所有玩家,实现了 O(log1+δT+W)O(\log^{1+\delta}T + W) 的近阶最优后悔,其中 WW 为至少有一个臂遭到對抗攻击的总时间单位数。

关键词

引用

@article{arxiv.2501.17882,
  title  = {Heterogeneous Multi-Player Multi-Armed Bandits Robust To Adversarial Attacks},
  author = {Akshayaa Magesh and Venugopal V. Veeravalli},
  journal= {arXiv preprint arXiv:2501.17882},
  year   = {2025}
}