中文

匹配市场中赌博机学习的玩家最优稳定后悔

机器学习 2023-07-21 v1

摘要

匹配市场问题因其广泛应用而在文献中被长期研究。寻找稳定匹配是该问题中常见的均衡目标。由于市场参与者通常不确定其偏好,近期大量工作研究了在线设定:其中一侧参与者(玩家)通过与另一侧(臂)的迭代交互学习其未知偏好。此类工作多数仅能推导玩家最差稳定后悔(player-pessimal stable regret)的理论保证,该后悔是相对于玩家最不偏好的稳定匹配定义的。然而,在最差稳定匹配下,玩家仅获得所有稳定匹配中的最小收益。为最大化玩家收益,玩家最优稳定匹配最为可取。尽管 \citet{basu21beyond} 成功给出了玩家最优稳定后悔的上界,但若玩家偏好间隙较小,其结果可能呈指数级大。是否存在该后悔的多项式保证是一个重要但仍未解决的问题。本工作中,我们提出名为探索后 Gale-Shapley (ETGS) 的新算法,并证明每个玩家的最优稳定后悔可被 O(KlogT/Δ2)O(K\log T/\Delta^2) 上界控制,其中 KK 为臂的数量,TT 为时间范围,Δ\Delta 为玩家在前 N+1N+1 个排名臂中的最小偏好间隙。该结果显著改进了先前工作或目标更弱的玩家最差稳定匹配,或仅适用于具特殊假设市场的工作。当参与者偏好满足某些特殊条件时,我们的后悔上界也与先前导出的下界相匹配。

关键词

引用

@article{arxiv.2307.10890,
  title  = {Player-optimal Stable Regret for Bandit Learning in Matching Markets},
  author = {Fang Kong and Shuai Li},
  journal= {arXiv preprint arXiv:2307.10890},
  year   = {2023}
}

备注

SODA 2023