中文

匹配市场中去中心化多臂赌博机超越 $\log^2(T)$ 后悔界

机器学习 2021-03-16 v1 机器学习

摘要

我们为具有单边赌博机反馈的双侧匹配市场设计了用于后悔最小化的去中心化算法,显著优于先前工作(Liu et al. 2020a, 2020b, Sankararaman et al. 2020)。首先,对于一般市场,对任意 ε>0\varepsilon > 0,我们设计了一种算法,在未知时间 horizon TT 下实现对 agent 最优稳定匹配 O(log1+ε(T))O(\log^{1+\varepsilon}(T)) 的后悔值,改进了 (Liu et al. 2020b) 中实现的 O(log2(T))O(\log^{2}(T)) 后悔值。其次,我们对满足唯一一致性——即离开的参与者不改变原始稳定匹配的市场——给出了最优的 Θ(log(T))\Theta(\log(T)) agent 最优后悔值。此前,Θ(log(T))\Theta(\log(T)) 后悔值仅在高度受限的串行独裁设定下(所有 arm 对 agent 具有相同偏好时)方可实现(Sankararaman et al. 2020, Liu et al. 2020b)。我们提出了一种基于阶段的算法,其中每个阶段除了删除全局通信的被支配 arm 外,agent 还本地删除与其频繁冲突的 arm。这种本地删除在打破由 agent 在 arm 间排名异质性引起的死锁中起着关键作用。我们通过仿真进一步证明了我们的算法优于现有工作。

关键词

引用

@article{arxiv.2103.07501,
  title  = {Beyond $\log^2(T)$ Regret for Decentralized Bandits in Matching Markets},
  author = {Soumya Basu and Karthik Abinav Sankararaman and Abishek Sankararaman},
  journal= {arXiv preprint arXiv:2103.07501},
  year   = {2021}
}