中文

具有次高斯奖励的上下文老虎机中 Thompson Sampling 后悔界

机器学习 2023-04-27 v1 机器学习

摘要

在这项工作中,我们基于 Neu 等人引入的框架及其提升信息比的概念,研究 Thompson Sampling 算法在上下文老虎机问题上的性能。首先,我们证明了依赖于环境参数与历史互信息的 Thompson Sampling 期望累积后悔的综合界。然后,我们引入了对次高斯奖励成立的提升信息比的新界,从而推广了 Neu 等人要求二值奖励的分析结果。最后,我们给出了无结构有界上下文老虎机、具有 Laplace 似然的结构化有界上下文老虎机、结构化 Bernoulli 老虎机以及有界线性上下文老虎机等特例的显式后悔界。

关键词

引用

@article{arxiv.2304.13593,
  title  = {Thompson Sampling Regret Bounds for Contextual Bandits with sub-Gaussian rewards},
  author = {Amaury Gouverneur and Borja Rodríguez-Gálvez and Tobias J. Oechtering and Mikael Skoglund},
  journal= {arXiv preprint arXiv:2304.13593},
  year   = {2023}
}

备注

8 pages: 5 of the main text, 1 of references, and 2 of appendices. Accepted to ISIT 2023