我的公平老虎机:基于多玩家老虎机的最大最小公平分布式学习
计算机科学与博弈论
2020-08-24 v4 多智能体系统
摘要
考虑 N 个协作但不通信的玩家,每个玩家在 T 轮中从 M 个臂中选择一个。玩家对每个臂具有不同的效用,可表示为 N×M 矩阵。这些效用对玩家未知。每轮玩家选择一个臂并获得其对该臂效用的噪声观测。然而,若其他任何玩家在该轮选择了同一臂,所有冲突玩家将因冲突而均获得零效用。玩家之间不可能进行其他通信或协调。我们的目标是设计一种分布式算法,学习玩家与臂之间的匹配,在实现最大最小公平的同时最小化后悔值。我们提出一种算法并证明其后悔值在最坏意义下仅相差 因子达到最优。这是首个具有(近)阶最优后悔值的最大最小公平多玩家老虎机算法。
引用
@article{arxiv.2002.09808,
title = {My Fair Bandit: Distributed Learning of Max-Min Fairness with Multi-player Bandits},
author = {Ilai Bistritz and Tavor Z. Baharav and Amir Leshem and Nicholas Bambos},
journal= {arXiv preprint arXiv:2002.09808},
year = {2020}
}
备注
ICML 2020