度量空间中的多人信息非对称 Bandit
机器学习
2025-03-14 v1 机器学习
摘要
近年来,信息非对称 Lipschitz bandit 问题备受关注。在本文中,我们研究了应用于 \cite{chang2022online, chang2023optimal} 中所探讨的多人信息非对称问题的 Lipschitz bandit 问题。更具体地说,我们考虑了在奖励、动作或两者中存在的信息非对称性。我们采用了 \cite{kleinberg2004nearly} 中给出的 CAB 算法,该算法使用固定离散化,在所有 3 种问题设置中给出了相同阶数(在动作空间维度上)的遗憾界。我们还采用了他们的 zooming 算法 \cite{kleinberg2008multi},该算法使用自适应离散化,并将其应用于奖励中的信息非对称和动作中的信息非对称。
引用
@article{arxiv.2503.08004,
title = {Multiplayer Information Asymmetric Bandits in Metric Spaces},
author = {William Chang and Aditi Karthik},
journal= {arXiv preprint arXiv:2503.08004},
year = {2025}
}