指数族多臂_bandit中Thompson采样算法的有限时间后悔
机器学习
2022-06-09 v1 机器学习
摘要
我们研究了指数族bandit的Thompson采样(TS)算法的后悔,其中奖励分布来自一维指数族,涵盖许多常见奖励分布,包括伯努利、高斯、伽马、指数等。我们提出了一种称为ExpTS的Thompson采样算法,其使用新颖的采样分布以避免对最优臂的低估。我们为ExpTS提供了紧致的后悔分析,同时给出有限时间后悔界与渐近后悔界。特别地,对于具有指数族奖励的臂bandit,ExpTS在时域内是sub-UCB的(一种依赖于问题的有限时间后悔强准则),至多为因子的极小极大最优,且对指数族奖励是渐近最优的。此外,我们提出ExpTS,在ExpTS所用采样分布基础上增加贪婪利用步骤,以避免对次优臂的高估。ExpTS是一种任意时刻bandit算法,并对指数族奖励分布同时实现极小极大最优与渐近最优。我们的证明技术具有通用性且概念简单,可轻松用于分析具有特定奖励分布的标准Thompson采样。
引用
@article{arxiv.2206.03520,
title = {Finite-Time Regret of Thompson Sampling Algorithms for Exponential Family Multi-Armed Bandits},
author = {Tianyuan Jin and Pan Xu and Xiaokui Xiao and Anima Anandkumar},
journal= {arXiv preprint arXiv:2206.03520},
year = {2022}
}
备注
49 pages