中文

面向多臂老虎机的高效自适应后验采样算法

机器学习 2024-05-03 v1 机器学习

摘要

我们研究基于 Thompson Sampling 的算法在具有 bounded 奖励的随机多臂老虎机中的应用。由于带有高斯先验的 Thompson Sampling 现有的依赖于问题的遗憾界在 T288e64T \le 288 e^{64} 时是无效的,我们推导出了一个更实用的界,将主导项的系数收紧。此外,受需要可扩展性、自适应计算资源分配以及平衡效用与计算的大规模实际应用驱动,我们提出了两种参数化的基于 Thompson Sampling 的算法:带有模型聚合的 Thompson Sampling (TS-MA-α\alpha) 和带有时间戳对决的 Thompson Sampling (TS-TD-α\alpha),其中 α[0,1]\alpha \in [0,1] 控制效用与计算之间的权衡。两种算法均实现了 O(Klnα+1(T)/Δ)O \left(K\ln^{\alpha+1}(T)/\Delta \right) 的遗憾界,其中 KK 是臂数,TT 是有限学习视野,Δ\Delta 表示拉动次优臂时的单轮性能损失。

关键词

引用

@article{arxiv.2405.01010,
  title  = {Efficient and Adaptive Posterior Sampling Algorithms for Bandits},
  author = {Bingshan Hu and Zhiming Huang and Tianyue H. Zhang and Mathias Lécuyer and Nidhi Hegde},
  journal= {arXiv preprint arXiv:2405.01010},
  year   = {2024}
}