中文

平稳混合老虎机

机器学习 2014-06-24 v1

摘要

我们研究了臂与平稳 ϕ\phi-混合过程相关联的老虎机问题,其中奖励是相关的:由此设置产生的问题是通过忽略某些奖励的值来恢复某种独立性。正如我们将看到的,我们要解决的老虎机问题需要处理探索/利用/独立性之间的权衡。为此,我们提供了一种 UCB 策略,并针对独立性块(被忽略的奖励)大小固定的情况给出了通用的遗憾分析;我们更进一步,提供了一种能够从数据中计算独立性块大小的算法。最后,我们对非平稳情况(即所有混合过程的时间计数器同时演变的情况)下的老虎机问题进行了分析。

关键词

引用

@article{arxiv.1406.6020,
  title  = {Stationary Mixing Bandits},
  author = {Julien Audiffren and Liva Ralaivola},
  journal= {arXiv preprint arXiv:1406.6020},
  year   = {2014}
}