Thompson采样策略的策略梯度优化
机器学习
2020-07-01 v1 人工智能
机器学习
摘要
我们研究使用策略梯度算法来优化一类广义Thompson采样策略。我们的核心见解是将Thompson采样所采样的后验参数视为一种伪动作。策略梯度方法从而可易处理地应用于搜索一类采样策略,这些策略确定关于伪动作(即采样参数)的概率分布,作为观测数据的函数。我们还提出并比较了专用于贝叶斯bandit问题的策略梯度估计量。数值实验表明,在Thompson采样之上直接进行策略搜索可自动纠正该算法一些已知缺陷,并在标准Thompson采样极为有效的长视野问题中也提供了有意义的改进。
关键词
引用
@article{arxiv.2006.16507,
title = {Policy Gradient Optimization of Thompson Sampling Policies},
author = {Seungki Min and Ciamac C. Moallemi and Daniel J. Russo},
journal= {arXiv preprint arXiv:2006.16507},
year = {2020}
}