匹配市场中的 bandit 学习:效用主义与罗尔斯主义视角
机器学习
2024-12-03 v1 计算机科学与博弈论
摘要
双边匹配市场在学校选拔、医学住院安置、电动车充电、叫车共享及推荐系统等众多实际应用中发挥了重要作用。然而,传统模型常常假设偏好是已知的,而在现代市场中偏好往往是未知的,需要学习。例如,一家公司在线市场上可能无法预先知道其对所有求职申请人的偏好。近期研究将匹配市场建模为多臂老虎机(MAB)问题,主要关注单侧市场的最优匹配,往往导致另一侧市场的次佳解。本文采用福利主义方法,关注两个指标:(1)效用福利(Utilitarian welfare)和(2)罗尔斯福利(Rawlsian welfare),同时维持市场稳定性。针对这些指标,我们提出了基于 epoch Explore-Then-Commit(ETC) 的算法,并分析了其后悔界。最后,我们进行了仿真实验来评估福利和市场稳定性。
引用
@article{arxiv.2412.00301,
title = {Bandit Learning in Matching Markets: Utilitarian and Rawlsian Perspectives},
author = {Hadi Hosseini and Duohan Zhang},
journal= {arXiv preprint arXiv:2412.00301},
year = {2024}
}