中文

PG-TS:面向逻辑上下文老虎机的改进Thompson采样

机器学习 2018-05-22 v1 机器学习

摘要

我们解决逻辑上下文老虎机中的遗憾最小化问题,其中学习器在给定各自上下文的连续动作或臂中决策以最大化二元奖励。利用具有Polya-Gamma分布增广变量的快速推断过程,我们提出了Thompson采样的一个改进版本,这是一种具有近最优性能的上下文老虎机的贝叶斯表述。我们的方法,Polya-Gamma增广Thompson采样(PG-TS),在模拟和真实数据上达到了最先进的性能。PG-TS高效地探索动作空间并利用高奖励臂,快速收敛到低遗憾的解。其对上下文特征协方差后验分布的显式估计带来了相对于近似方法的显著实证增益。PG-TS是首个证明Polya-Gamma增广在老虎机中益处并提出高效Gibbs采样器来近似逻辑上下文老虎机中解析不可解积分的方法。

关键词

引用

@article{arxiv.1805.07458,
  title  = {PG-TS: Improved Thompson Sampling for Logistic Contextual Bandits},
  author = {Bianca Dumitrascu and Karen Feng and Barbara E Engelhardt},
  journal= {arXiv preprint arXiv:1805.07458},
  year   = {2018}
}