切换环境中结合贝叶斯在线变点检测的汤普森采样
机器学习
2013-02-18 v1
摘要
汤普森采样(Thompson Sampling)最近被证明在伯努利多臂老虎机(Bernoulli Multi-Armed Bandit)设定中是最优的[Kaufmann et al., 2012]。该老虎机问题假设奖励服从平稳分布。然而,将现实世界建模为平稳分布通常是不切实际的。本文针对切换式多臂老虎机问题,推导并评估了使用汤普森采样的算法。我们提出了一种配备贝叶斯变点机制的汤普森采样策略来解决该问题。我们为具有恒定切换率的多种情况开发了算法:当切换发生时所有臂都改变(全局切换),切换独立地发生在每个臂上(逐臂切换),以及切换率已知和必须从数据中推断的情况。这产生了一系列我们统称为变点汤普森采样(Change-Point Thompson Sampling, CTS)的算法。我们在4个人工环境和2个源自真实世界数据的环境(新闻点击率[Yahoo!, 2011]和外汇数据[Dukascopy, 2012])中展示了该算法的实证结果,并将其与其他一些老虎机算法进行了比较。在真实世界数据中,CTS最为有效。
引用
@article{arxiv.1302.3721,
title = {Thompson Sampling in Switching Environments with Bayesian Online Change Point Detection},
author = {Joseph Mellor and Jonathan Shapiro},
journal= {arXiv preprint arXiv:1302.3721},
year = {2013}
}
备注
A version will appear in the Sixteenth international conference on Artificial Intelligence and Statistics (AIStats 2013)