中文

指数族多臂_bandit中Thompson采样算法的有限时间后悔

机器学习 2022-06-09 v1 机器学习

摘要

我们研究了指数族bandit的Thompson采样(TS)算法的后悔,其中奖励分布来自一维指数族,涵盖许多常见奖励分布,包括伯努利、高斯、伽马、指数等。我们提出了一种称为ExpTS的Thompson采样算法,其使用新颖的采样分布以避免对最优臂的低估。我们为ExpTS提供了紧致的后悔分析,同时给出有限时间后悔界与渐近后悔界。特别地,对于具有指数族奖励的KK臂bandit,ExpTS在时域TT内是sub-UCB的(一种依赖于问题的有限时间后悔强准则),至多为logK\sqrt{\log K}因子的极小极大最优,且对指数族奖励是渐近最优的。此外,我们提出ExpTS+^+,在ExpTS所用采样分布基础上增加贪婪利用步骤,以避免对次优臂的高估。ExpTS+^+是一种任意时刻bandit算法,并对指数族奖励分布同时实现极小极大最优与渐近最优。我们的证明技术具有通用性且概念简单,可轻松用于分析具有特定奖励分布的标准Thompson采样。

关键词

引用

@article{arxiv.2206.03520,
  title  = {Finite-Time Regret of Thompson Sampling Algorithms for Exponential Family Multi-Armed Bandits},
  author = {Tianyuan Jin and Pan Xu and Xiaokui Xiao and Anima Anandkumar},
  journal= {arXiv preprint arXiv:2206.03520},
  year   = {2022}
}

备注

49 pages