组合半臂老虎机的汤普森采样:多项式遗憾与失配采样悖论
机器学习
2024-10-10 v1 机器学习
摘要
我们研究了线性组合半臂老虎机问题中的汤普森采样(TS)算法,并考虑了次高斯奖励。我们提出了第一个已知的TS算法,其有限时间遗憾不随问题维度呈指数增长。我们进一步展示了“失配采样悖论”:一个知道奖励分布并从正确后验分布中采样的学习者的表现,可能比一个不知道奖励分布但仅从精心选择的高斯先验中采样的学习者差指数级。用于生成实验的代码可在 https://github.com/RaymZhang/CTS-Mismatched-Paradox 获取。
引用
@article{arxiv.2410.05441,
title = {Thompson Sampling For Combinatorial Bandits: Polynomial Regret and Mismatched Sampling Paradox},
author = {Raymond Zhang and Richard Combes},
journal= {arXiv preprint arXiv:2410.05441},
year = {2024}
}
备注
NeurIPS 2024