非平稳匹配市场中的去中心化竞争_bandits
机器学习
2022-06-02 v1 信息论
机器学习
math.IT
摘要
理解双边在线匹配市场的复杂动态——其中需求侧 agent 竞争与供给侧(臂)匹配——近期受到大量关注。为此,本文引入非平稳(动态)环境下的去中心化双边匹配市场框架。我们遵循串行独裁设定,其中需求侧 agent 对供给侧(臂)有未知且各异的偏好,但臂对 agent 有固定且已知的偏好。我们提出并分析了一种去中心化异步学习算法,即去中心化非平稳竞争_bandits(\texttt{DNCB}),其中 agent 采用(受限)连续消去型学习算法来学习其对臂的偏好。理解此类系统的复杂性源于:竞争_bandits 以异步方式选择动作,且排名较低的 agent 仅能从一组未被较高排名 agent 主导的臂中学习,这导致强制探索。通过精心定义的复杂度参数,我们刻画了该强制探索并获得 \texttt{DNCB} 的次线性(对数)后悔。此外,我们通过实验验证了理论发现。
引用
@article{arxiv.2206.00120,
title = {Decentralized Competing Bandits in Non-Stationary Matching Markets},
author = {Avishek Ghosh and Abishek Sankararaman and Kannan Ramchandran and Tara Javidi and Arya Mazumdar},
journal= {arXiv preprint arXiv:2206.00120},
year = {2022}
}