中文

有界奖励多臂 Bandit 的 Kullback-Leibler Maillard 采样

机器学习 2024-04-15 v4 机器学习

摘要

我们研究 KK 臂 bandit 问题,其中各臂的奖励分布均支撑于 [0,1][0,1] 区间。在此设定下设计 regret 高效的随机探索算法一直是一项挑战。Maillard 采样 \cite{maillard13apprentissage} 作为 Thompson 采样的一种有吸引力的替代方案,最近被证明在次高斯奖励设定下 \cite{bian2022maillard} 取得具竞争力的 regret 保证,同时保持闭式动作概率,这有利于离线策略评估。本工作中,我们提出 Kullback-Leibler Maillard 采样(KL-MS)算法,它是 Maillard 采样的一种自然扩展,用于实现 KL 风格的依赖于间隙的 regret 界。我们证明当奖励为 Bernoulli 时 KL-MS 具有渐近最优性,且其最坏情况 regret 界形式为 O(μ(1μ)KTlnK+KlnT)O(\sqrt{\mu^*(1-\mu^*) K T \ln K} + K \ln T),其中 μ\mu^* 为最优臂的期望奖励,TT 为时间范围长度。

关键词

引用

@article{arxiv.2304.14989,
  title  = {Kullback-Leibler Maillard Sampling for Multi-armed Bandits with Bounded Rewards},
  author = {Hao Qin and Kwang-Sung Jun and Chicheng Zhang},
  journal= {arXiv preprint arXiv:2304.14989},
  year   = {2024}
}

备注

Accepted by NeurIPS 2023