匹配市场中赌博机学习的玩家最优稳定后悔
机器学习
2023-07-21 v1
摘要
匹配市场问题因其广泛应用而在文献中被长期研究。寻找稳定匹配是该问题中常见的均衡目标。由于市场参与者通常不确定其偏好,近期大量工作研究了在线设定:其中一侧参与者(玩家)通过与另一侧(臂)的迭代交互学习其未知偏好。此类工作多数仅能推导玩家最差稳定后悔(player-pessimal stable regret)的理论保证,该后悔是相对于玩家最不偏好的稳定匹配定义的。然而,在最差稳定匹配下,玩家仅获得所有稳定匹配中的最小收益。为最大化玩家收益,玩家最优稳定匹配最为可取。尽管 \citet{basu21beyond} 成功给出了玩家最优稳定后悔的上界,但若玩家偏好间隙较小,其结果可能呈指数级大。是否存在该后悔的多项式保证是一个重要但仍未解决的问题。本工作中,我们提出名为探索后 Gale-Shapley (ETGS) 的新算法,并证明每个玩家的最优稳定后悔可被 上界控制,其中 为臂的数量, 为时间范围, 为玩家在前 个排名臂中的最小偏好间隙。该结果显著改进了先前工作或目标更弱的玩家最差稳定匹配,或仅适用于具特殊假设市场的工作。当参与者偏好满足某些特殊条件时,我们的后悔上界也与先前导出的下界相匹配。
关键词
引用
@article{arxiv.2307.10890,
title = {Player-optimal Stable Regret for Bandit Learning in Matching Markets},
author = {Fang Kong and Shuai Li},
journal= {arXiv preprint arXiv:2307.10890},
year = {2023}
}
备注
SODA 2023