中文

多玩家老虎机中的自私鲁棒性与均衡

机器学习 2020-06-22 v2 机器学习

摘要

受认知无线电的推动,随机多玩家多臂老虎机近来备受关注。在这类问题中,若干玩家同时拉动臂,若有人同时拉动同一臂则发生碰撞——奖励为 0。虽主要考虑玩家最大化集体奖励(顺从遵循某固定协议)的协作情形,但对恶意玩家的鲁棒性是一关键且具挑战的议题。现有方法仅考虑以盲目最小化集体奖励为目标的对抗性干扰者。我们转而考虑更自然的自私玩家类,其激励为最大化个体奖励,可能以社会福祉为代价。我们给出首个对自私玩家(即纳什均衡)鲁棒且具对数后悔(regret)的算法,当可观测臂性能时。当碰撞亦可观测时,Grim Trigger 类策略促成某些基于隐式通信的算法,我们构建了两种设定下的鲁棒算法:同质情形(后悔与集中式最优者相当)与异质情形(针对一种适配且相关的后悔概念)。我们还给出了仅可观测奖励或臂均值在玩家间任意变化时的不可能性结果。

关键词

引用

@article{arxiv.2002.01197,
  title  = {Selfish Robustness and Equilibria in Multi-Player Bandits},
  author = {Etienne Boursier and Vianney Perchet},
  journal= {arXiv preprint arXiv:2002.01197},
  year   = {2020}
}