匹配市场中用于赌博机学习的汤普森采样
机器学习
2022-05-03 v2 计算机科学与博弈论
摘要
双边匹配市场问题具有广泛的现实应用,并已在文献中被广泛研究。一系列近期工作聚焦于这样一种问题设置:单边市场参与者的偏好是先验未知的,并通过与另一方参与者的迭代交互来学习。所有这些工作都基于探索后提交(ETC)和上置信界(UCB)算法,即多臂赌博机(MAB)中的两种常见策略。汤普森采样(TS)是另一种流行的方法,因其更易实现和更好的经验性能而备受关注。在许多问题中,即使UCB和ETC型算法已被分析,研究人员仍因其优势而尝试研究TS。然而,TS的收敛分析更具挑战性,且在许多问题设置中仍属开放问题。在本文中,我们针对迭代匹配市场这一新设置,首次给出了TS的悔值分析。大量实验展示了TS型算法相对于ETC和UCB型基线的实际优势。
引用
@article{arxiv.2204.12048,
title = {Thompson Sampling for Bandit Learning in Matching Markets},
author = {Fang Kong and Junming Yin and Shuai Li},
journal= {arXiv preprint arXiv:2204.12048},
year = {2022}
}
备注
Accepted in IJCAI'2022