中文

面向组合半赌博机问题的 Thompson 采样

机器学习 2022-06-22 v5

摘要

在本文中,我们研究了 Thompson 采样(TS)方法在随机组合多臂赌博机(CMAB)框架中的应用。我们首先分析了通用 CMAB 模型在标准 TS 算法下的情况,其中所有基臂的结果分布相互独立,并得到了依赖于分布的悔恨上界 O(mlogKmaxlogT/Δmin)O(m\log K_{\max}\log T / \Delta_{\min}),其中 mm 为基臂数量,KmaxK_{\max} 为最大超臂的规模,TT 为时间范围,Δmin\Delta_{\min} 为最优解的期望奖励与任意非最优解之间的最小间隙。该悔恨上界优于先前工作中的 O(m(logKmax)2logT/Δmin)O(m(\log K_{\max})^2\log T / \Delta_{\min}) 界。此外,我们的新颖分析技术有助于收紧其他现有基于 UCB 的策略(例如 ESCB)的悔恨界,因为我们改进了累积悔恨的计数方法。然后我们考虑拟阵赌博机设置(CMAB 模型的一个特殊类),在其中可以去除臂间的独立性假设,并获得与下界匹配的悔恨上界。除了悔恨上界,我们还指出,即使在经典 MAB 问题中,也不能在 TS 算法中直接将精确离线预言机(将离线问题实例的参数作为输入并输出该实例下的精确最佳动作)替换为近似预言机。最后,我们用一些实验展示了 TS 与其他现有算法的悔恨比较,实验结果表明 TS 优于现有基线。

关键词

引用

@article{arxiv.1803.04623,
  title  = {Thompson Sampling for Combinatorial Semi-Bandits},
  author = {Siwei Wang and Wei Chen},
  journal= {arXiv preprint arXiv:1803.04623},
  year   = {2022}
}