时变匹配市场中的竞争型多臂赌博机
机器学习
2023-01-16 v2 计算机科学与博弈论
多智能体系统
摘要
我们研究双边非平稳匹配市场中的在线学习问题,其目标是收敛到稳定匹配。具体地,我们考虑市场一侧(臂)对另一侧(参与者)具有固定已知偏好集合的情形。尽管该问题在参与者具有固定但未知偏好时已被研究,本文研究当参与者的偏好时变且未知时如何学习。我们的贡献是一种可处理任意偏好结构与变化场景的方法。我们证明,所提算法下每个参与者获得均匀的亚线性后悔界 {},直至智能体底层偏好的变化次数 。因此,我们表明尽管存在竞争,单智能体学习的最优速率仍可达,仅相差常数因子。我们还讨论了该算法在变化次数无需先验已知情形下的扩展。
引用
@article{arxiv.2210.11692,
title = {Competing Bandits in Time Varying Matching Markets},
author = {Deepan Muthirayan and Chinmay Maheshwari and Pramod P. Khargonekar and Shankar Sastry},
journal= {arXiv preprint arXiv:2210.11692},
year = {2023}
}