有界奖励多臂 Bandit 的 Kullback-Leibler Maillard 采样
机器学习
2024-04-15 v4 机器学习
摘要
我们研究 臂 bandit 问题,其中各臂的奖励分布均支撑于 区间。在此设定下设计 regret 高效的随机探索算法一直是一项挑战。Maillard 采样 \cite{maillard13apprentissage} 作为 Thompson 采样的一种有吸引力的替代方案,最近被证明在次高斯奖励设定下 \cite{bian2022maillard} 取得具竞争力的 regret 保证,同时保持闭式动作概率,这有利于离线策略评估。本工作中,我们提出 Kullback-Leibler Maillard 采样(KL-MS)算法,它是 Maillard 采样的一种自然扩展,用于实现 KL 风格的依赖于间隙的 regret 界。我们证明当奖励为 Bernoulli 时 KL-MS 具有渐近最优性,且其最坏情况 regret 界形式为 ,其中 为最优臂的期望奖励, 为时间范围长度。
引用
@article{arxiv.2304.14989,
title = {Kullback-Leibler Maillard Sampling for Multi-armed Bandits with Bounded Rewards},
author = {Hao Qin and Kwang-Sung Jun and Chicheng Zhang},
journal= {arXiv preprint arXiv:2304.14989},
year = {2024}
}
备注
Accepted by NeurIPS 2023