面向多臂老虎机实值组合纯探索的汤普森采样
机器学习
2023-11-16 v3 机器学习
摘要
我们研究多臂老虎机(R-CPE-MAB)的实值组合纯探索问题。在 R-CPE-MAB 中,玩家给定 个随机臂,每个臂 的奖励服从均值 的未知分布。在每个时间步,玩家拉动单个臂并观测其奖励。玩家的目标是从有限大小的实值动作集 中以尽可能少的拉臂次数识别出最优动作 。R-CPE-MAB 的先前方法假设动作集 的大小关于 为多项式级。我们提出了一种名为广义汤普森采样探索(GenTS-Explore)算法的算法,它是首个即便动作集大小关于 指数级大时也能工作的算法。我们还引入了 R-CPE-MAB 问题的一个新的问题依赖样本复杂度下界,并证明 GenTS-Explore 算法达到最优样本复杂度,仅差一个依赖于问题的常数因子。
引用
@article{arxiv.2308.10238,
title = {Thompson Sampling for Real-Valued Combinatorial Pure Exploration of Multi-Armed Bandit},
author = {Shintaro Nakamura and Masashi Sugiyama},
journal= {arXiv preprint arXiv:2308.10238},
year = {2023}
}