中文

时变匹配市场中的竞争型多臂赌博机

机器学习 2023-01-16 v2 计算机科学与博弈论 多智能体系统

摘要

我们研究双边非平稳匹配市场中的在线学习问题,其目标是收敛到稳定匹配。具体地,我们考虑市场一侧(臂)对另一侧(参与者)具有固定已知偏好集合的情形。尽管该问题在参与者具有固定但未知偏好时已被研究,本文研究当参与者的偏好时变且未知时如何学习。我们的贡献是一种可处理任意偏好结构与变化场景的方法。我们证明,所提算法下每个参与者获得均匀的亚线性后悔界 {O~(LT1/2T1/2)\widetilde{\mathcal{O}}(L^{1/2}_TT^{1/2})},直至智能体底层偏好的变化次数 LTL_T。因此,我们表明尽管存在竞争,单智能体学习的最优速率仍可达,仅相差常数因子。我们还讨论了该算法在变化次数无需先验已知情形下的扩展。

关键词

引用

@article{arxiv.2210.11692,
  title  = {Competing Bandits in Time Varying Matching Markets},
  author = {Deepan Muthirayan and Chinmay Maheshwari and Pramod P. Khargonekar and Shankar Sastry},
  journal= {arXiv preprint arXiv:2210.11692},
  year   = {2023}
}