中文

面向多臂老虎机实值组合纯探索的汤普森采样

机器学习 2023-11-16 v3 机器学习

摘要

我们研究多臂老虎机(R-CPE-MAB)的实值组合纯探索问题。在 R-CPE-MAB 中,玩家给定 dd 个随机臂,每个臂 s{1,,d}s\in\{1, \ldots, d\} 的奖励服从均值 μs\mu_s 的未知分布。在每个时间步,玩家拉动单个臂并观测其奖励。玩家的目标是从有限大小的实值动作集 ARd\mathcal{A}\subset \mathbb{R}^{d} 中以尽可能少的拉臂次数识别出最优动作 π=arg maxπAμπ\boldsymbol{\pi}^{*} = \argmax_{\boldsymbol{\pi} \in \mathcal{A}} \boldsymbol{\mu}^{\top}\boldsymbol{\pi}。R-CPE-MAB 的先前方法假设动作集 A\mathcal{A} 的大小关于 dd 为多项式级。我们提出了一种名为广义汤普森采样探索(GenTS-Explore)算法的算法,它是首个即便动作集大小关于 dd 指数级大时也能工作的算法。我们还引入了 R-CPE-MAB 问题的一个新的问题依赖样本复杂度下界,并证明 GenTS-Explore 算法达到最优样本复杂度,仅差一个依赖于问题的常数因子。

关键词

引用

@article{arxiv.2308.10238,
  title  = {Thompson Sampling for Real-Valued Combinatorial Pure Exploration of Multi-Armed Bandit},
  author = {Shintaro Nakamura and Masashi Sugiyama},
  journal= {arXiv preprint arXiv:2308.10238},
  year   = {2023}
}