关于突变与缓变多臂_bandit问题
机器学习
2018-04-25 v2 机器学习
摘要
我们研究非平稳随机多臂_bandit(MAB)问题,并提出两种通用算法,即有限记忆确定性探索与利用序列(LM-DSEE)与滑动窗口上置信界#(SW-UCB#)。我们在突变与缓变环境中严格分析这些算法并刻画其性能。我们表明,在任一环境下这些算法的期望累积后悔均被时间的亚线性函数上界限制,即后悔的时间平均值渐近收敛于零。我们以数值说明补充了分析结果。
引用
@article{arxiv.1802.08380,
title = {On Abruptly-Changing and Slowly-Varying Multiarmed Bandit Problems},
author = {Lai Wei and Vaibhav Srivastava},
journal= {arXiv preprint arXiv:1802.08380},
year = {2018}
}