中文

最小奖励保证公平性下的多主体多臂老虎机

机器学习 2025-06-23 v2 系统与控制 系统与控制

摘要

我们研究了在多主体多臂老虎机(MA-MAB)设置中在确保公平性的前提下最大化社会福利的问题。在该问题中,中心化决策者随着时间推移采取行动,为各种主体生成随机奖励。我们的目标是最大化预期累积奖励之和(即社会福利),同时确保每个主体至少获得最大可能预期奖励的常数分数。我们提出的算法 RewardFairUCB 利用上置置界(UCB)技术,为公平性和社会福利均实现亚线性 regret 上界。公平 regret 测量的是最小奖励保证与给定策略预期奖励之间的正差,而社会福利 regret 测量的是最优公平策略的社会福利与给定策略的社会福利之间的差异。我们证明 RewardFairUCB 算法实现了实例无关的社会福利 regret 上界为 O~(T1/2)\tilde{O}(T^{1/2}),且公平 regret 上界为 O~(T3/4)\tilde{O}(T^{3/4})。我们还给出社会福利和公平 regret 的下界为 Ω(T)\Omega(\sqrt{T})。我们使用模拟数据和真实世界数据对 RewardFairUCB 的性能进行了对比,评估了其与各种基线和启发式算法的表现,凸显了公平性和社会福利 regret 之间的权衡。

关键词

引用

@article{arxiv.2502.15240,
  title  = {Multi-agent Multi-armed Bandits with Minimum Reward Guarantee Fairness},
  author = {Piyushi Manupriya and Himanshu and SakethaNath Jagarlapudi and Ganesh Ghalme},
  journal= {arXiv preprint arXiv:2502.15240},
  year   = {2025}
}