中文

具有正态-伽马先验的线性bandit问题中的Thompson采样

机器学习 2023-03-07 v1 人工智能 机器学习

摘要

我们考虑具有有限多个独立臂的线性bandit问题中的Thompson采样,其中奖励从正态分布中采样,该分布与未知参数向量线性相关且方差未知。具体地,采用贝叶斯公式,我们考虑多元正态-伽马先验来表示所有相关参数的环境不确定性。我们证明所选择的采样先验是奖励模型的共轭先验,并推导了在方差分布的5/2阶矩存在的条件下Thompson采样的贝叶斯后悔界。

关键词

引用

@article{arxiv.2303.03348,
  title  = {Thompson Sampling for Linear Bandit Problems with Normal-Gamma Priors},
  author = {Björn Lindenberg and Karl-Olof Lindahl},
  journal= {arXiv preprint arXiv:2303.03348},
  year   = {2023}
}

备注

27 pages, 2 figures