随机多臂老虎机多选择问题中 Thompson 采样的最优后悔分析
机器学习
2019-03-22 v3 机器学习
摘要
我们讨论多选择多臂老虎机(MAB)问题,其中每轮选择若干臂。近来,具有贝叶斯精神的随机化算法 Thompson 采样(TS)因其卓越的实证性能而备受关注,且已被揭示在标准的单选择 MAB 问题中具有最优后悔界。本文提出多选择 Thompson 采样(MP-TS)算法,即 TS 至多选择 MAB 问题的扩展,并讨论其后悔分析。我们证明用于二元奖励的 MP-TS 具有与 Anantharam 等人(1987)给出的后悔下界相匹配的最优后悔上界。因此,MP-TS 是首个具有最优后悔且计算高效的算法。我们还进行了一组计算机仿真,将 MP-TS 与最先进算法进行比较。我们还提出了 MP-TS 的一种改进,其被证明具有更好的实证性能。
引用
@article{arxiv.1506.00779,
title = {Optimal Regret Analysis of Thompson Sampling in Stochastic Multi-armed Bandit Problem with Multiple Plays},
author = {Junpei Komiyama and Junya Honda and Hiroshi Nakagawa},
journal= {arXiv preprint arXiv:1506.00779},
year = {2019}
}
备注
Appeared in ICML2015. Fixed the evaluation of term (B) in Lemma 3. Replaced \tilde{\mu}->\theta