中文

诚实的胜者:在在线公平分配中实现无懊恼学习

计算机科学与博弈论 2024-12-10 v3 机器学习

摘要

我们考虑在有限物品类型且玩家价值来源于均值未知分布的情形下,对不可分割物品进行在线公平分配的问题。目标是在满足公平期望分配的前提下最大化社会福祉。当玩家对某物品的价值在分配时刻尚未知晓时,我们证明该问题可归约为一种(随机)多臂老虎机的变体:为每一种物品类型中每个玩家的价值设立一个老虎机臂。每一步,我们选择一种分布 over臂位,决定下一件物品的分配方式。我们为该问题设定两种公平约束:按期望的嫉妒自由与按期望的比例公平。我们的主要结果是设计一种探查-提交(explore-then-commit)算法,实现 O~(T2/3)\tilde{O}(T^{2/3}) 的无懊恼(regret),同时满足上述任一公平约束。该结果依赖于公平分配约束的独特性质,使学习速率得以提升,尽管行动空间受限。我们还证明了该设置下存在 Ω~(T2/3)\tilde{\Omega}(T^{2/3}) 的下界,表明结果紧密。

关键词

引用

@article{arxiv.2407.01795,
  title  = {Honor Among Bandits: No-Regret Learning for Online Fair Division},
  author = {Ariel D. Procaccia and Benjamin Schiffer and Shirley Zhang},
  journal= {arXiv preprint arXiv:2407.01795},
  year   = {2024}
}