面向组合半赌博机问题的 Thompson 采样
机器学习
2022-06-22 v5
摘要
在本文中,我们研究了 Thompson 采样(TS)方法在随机组合多臂赌博机(CMAB)框架中的应用。我们首先分析了通用 CMAB 模型在标准 TS 算法下的情况,其中所有基臂的结果分布相互独立,并得到了依赖于分布的悔恨上界 ,其中 为基臂数量, 为最大超臂的规模, 为时间范围, 为最优解的期望奖励与任意非最优解之间的最小间隙。该悔恨上界优于先前工作中的 界。此外,我们的新颖分析技术有助于收紧其他现有基于 UCB 的策略(例如 ESCB)的悔恨界,因为我们改进了累积悔恨的计数方法。然后我们考虑拟阵赌博机设置(CMAB 模型的一个特殊类),在其中可以去除臂间的独立性假设,并获得与下界匹配的悔恨上界。除了悔恨上界,我们还指出,即使在经典 MAB 问题中,也不能在 TS 算法中直接将精确离线预言机(将离线问题实例的参数作为输入并输出该实例下的精确最佳动作)替换为近似预言机。最后,我们用一些实验展示了 TS 与其他现有算法的悔恨比较,实验结果表明 TS 优于现有基线。
引用
@article{arxiv.1803.04623,
title = {Thompson Sampling for Combinatorial Semi-Bandits},
author = {Siwei Wang and Wei Chen},
journal= {arXiv preprint arXiv:1803.04623},
year = {2022}
}