中文

随机多臂老虎机多选择问题中 Thompson 采样的最优后悔分析

机器学习 2019-03-22 v3 机器学习

摘要

我们讨论多选择多臂老虎机(MAB)问题,其中每轮选择若干臂。近来,具有贝叶斯精神的随机化算法 Thompson 采样(TS)因其卓越的实证性能而备受关注,且已被揭示在标准的单选择 MAB 问题中具有最优后悔界。本文提出多选择 Thompson 采样(MP-TS)算法,即 TS 至多选择 MAB 问题的扩展,并讨论其后悔分析。我们证明用于二元奖励的 MP-TS 具有与 Anantharam 等人(1987)给出的后悔下界相匹配的最优后悔上界。因此,MP-TS 是首个具有最优后悔且计算高效的算法。我们还进行了一组计算机仿真,将 MP-TS 与最先进算法进行比较。我们还提出了 MP-TS 的一种改进,其被证明具有更好的实证性能。

关键词

引用

@article{arxiv.1506.00779,
  title  = {Optimal Regret Analysis of Thompson Sampling in Stochastic Multi-armed Bandit Problem with Multiple Plays},
  author = {Junpei Komiyama and Junya Honda and Hiroshi Nakagawa},
  journal= {arXiv preprint arXiv:1506.00779},
  year   = {2019}
}

备注

Appeared in ICML2015. Fixed the evaluation of term (B) in Lemma 3. Replaced \tilde{\mu}->\theta