中文

具有激励相容性的多对一匹配市场中改进的赌博机算法

机器学习 2024-06-04 v2 计算机科学与博弈论

摘要

双边匹配市场因其丰富的应用而在文献中得到广泛研究。由于参与者通常不确定自己的偏好,最近采用在线算法通过迭代交互来学习这些偏好。现有工作在有响应性的多对一设置中开创了对此问题的研究。然而,他们的结果远非最优,且缺乏激励相容性保证。我们首先将一种用于一对一设置的现有算法扩展到这种更一般的设置,并证明它达到了玩家最优遗憾的近乎最优界。然而,由于对协作的实质性要求,单个玩家的偏离可能导致其自身累积奖励的巨大增加以及他人的线性遗憾。在本文中,我们旨在提高多对一市场中的遗憾界,同时确保激励相容性。我们首先针对响应性设置提出了自适应探索-然后-延迟接受(AETDA)算法,并推导了玩家最优稳定遗憾的上界,同时证明了其激励相容性保证。据我们所知,这是匹配市场中第一个多项式玩家最优保证,在未知Δ(玩家与臂之间的偏好差距)的情况下提供了如此稳健的保证。我们还考虑了更广泛的替代偏好,这是确保稳定匹配存在的最一般条件之一,并涵盖了响应性。我们设计了一种在线DA(ODA)算法,并为此设置建立了玩家最差稳定遗憾的上界。

关键词

引用

@article{arxiv.2401.01528,
  title  = {Improved Bandits in Many-to-one Matching Markets with Incentive Compatibility},
  author = {Fang Kong and Shuai Li},
  journal= {arXiv preprint arXiv:2401.01528},
  year   = {2024}
}

备注

AAAI 2024