具有正态-伽马先验的线性bandit问题中的Thompson采样
机器学习
2023-03-07 v1 人工智能
机器学习
摘要
我们考虑具有有限多个独立臂的线性bandit问题中的Thompson采样,其中奖励从正态分布中采样,该分布与未知参数向量线性相关且方差未知。具体地,采用贝叶斯公式,我们考虑多元正态-伽马先验来表示所有相关参数的环境不确定性。我们证明所选择的采样先验是奖励模型的共轭先验,并推导了在方差分布的5/2阶矩存在的条件下Thompson采样的贝叶斯后悔界。
引用
@article{arxiv.2303.03348,
title = {Thompson Sampling for Linear Bandit Problems with Normal-Gamma Priors},
author = {Björn Lindenberg and Karl-Olof Lindahl},
journal= {arXiv preprint arXiv:2303.03348},
year = {2023}
}
备注
27 pages, 2 figures