面向多臂老虎机的高效自适应后验采样算法
机器学习
2024-05-03 v1 机器学习
摘要
我们研究基于 Thompson Sampling 的算法在具有 bounded 奖励的随机多臂老虎机中的应用。由于带有高斯先验的 Thompson Sampling 现有的依赖于问题的遗憾界在 时是无效的,我们推导出了一个更实用的界,将主导项的系数收紧。此外,受需要可扩展性、自适应计算资源分配以及平衡效用与计算的大规模实际应用驱动,我们提出了两种参数化的基于 Thompson Sampling 的算法:带有模型聚合的 Thompson Sampling (TS-MA-) 和带有时间戳对决的 Thompson Sampling (TS-TD-),其中 控制效用与计算之间的权衡。两种算法均实现了 的遗憾界,其中 是臂数, 是有限学习视野, 表示拉动次优臂时的单轮性能损失。
引用
@article{arxiv.2405.01010,
title = {Efficient and Adaptive Posterior Sampling Algorithms for Bandits},
author = {Bingshan Hu and Zhiming Huang and Tianyue H. Zhang and Mathias Lécuyer and Nidhi Hegde},
journal= {arXiv preprint arXiv:2405.01010},
year = {2024}
}