诚实的胜者:在在线公平分配中实现无懊恼学习
计算机科学与博弈论
2024-12-10 v3 机器学习
摘要
我们考虑在有限物品类型且玩家价值来源于均值未知分布的情形下,对不可分割物品进行在线公平分配的问题。目标是在满足公平期望分配的前提下最大化社会福祉。当玩家对某物品的价值在分配时刻尚未知晓时,我们证明该问题可归约为一种(随机)多臂老虎机的变体:为每一种物品类型中每个玩家的价值设立一个老虎机臂。每一步,我们选择一种分布 over臂位,决定下一件物品的分配方式。我们为该问题设定两种公平约束:按期望的嫉妒自由与按期望的比例公平。我们的主要结果是设计一种探查-提交(explore-then-commit)算法,实现 的无懊恼(regret),同时满足上述任一公平约束。该结果依赖于公平分配约束的独特性质,使学习速率得以提升,尽管行动空间受限。我们还证明了该设置下存在 的下界,表明结果紧密。
引用
@article{arxiv.2407.01795,
title = {Honor Among Bandits: No-Regret Learning for Online Fair Division},
author = {Ariel D. Procaccia and Benjamin Schiffer and Shirley Zhang},
journal= {arXiv preprint arXiv:2407.01795},
year = {2024}
}